6 Downloads Updated 2 days ago
ollama run tranhuythang9999/clef-flash
Mô hình clef-flash:latest là phiên bản tối ưu hóa hiệu năng cao, dung lượng 6.8 GB, hỗ trợ xử lý ngữ cảnh nhanh (flash-attention) và tương thích hoàn toàn với các tính năng thế hệ mới của Ollama, đặc biệt là điểm cuối cấu trúc Ollama System One.
Yêu cầu Ollama phiên bản v0.35.0 trở lên.
Tính năng này ép mô hình xử lý toán học trực tiếp trên xác suất phân loại để trả về cấu trúc định dạng JSON siêu tốc. Kết quả đầu ra chỉ tiêu tốn đúng 1 output token, giúp loại bỏ hoàn toàn các văn bản thừa và tiết kiệm tài nguyên hệ thống tối đa.
type: "choice")Tự động nhận diện nội dung văn bản để điều hướng (Routing) công việc về đúng bộ phận xử lý mà không cần viết hàm bóc tách dữ liệu phức tạp.
import requests
import json
url = "http://localhost:11434/v1/systemone"
payload = {
"model": "tranhuythang9999/clef-flash:latest",
"state": "Hệ thống thanh toán lỗi, tôi bị trừ tiền 2 lần!",
"questions": {
"phong_ban": {
"type": "choice",
"instructions": "Phân loại yêu cầu này thuộc phòng ban nào xử lý?",
"criteria": {
"ky_thuat": "Lỗi phần mềm, bug hệ thống, không kết nối được",
"ke_toan": "Vấn đề tiền bạc, hóa đơn, hoàn tiền, thanh toán"
}
}
}
}
response = requests.post(url, headers={"Content-Type": "application/json"}, data=json.dumps(payload))
print(json.dumps(response.json(), indent=2, ensure_ascii=False))
Kết quả trả về mẫu:
{
"model": "tranhuythang9999/clef-flash:latest",
"answers": {
"phong_ban": {
"type": "choice",
"choice": "ke_toan",
"probabilities": {
"ky_thuat": 4.548642073805983e-13,
"ke_toan": 0.999999999999545
},
"confidence": 0.9999999999806943
}
},
"usage": {
"input_tokens": 122,
"output_tokens": 1
}
}
🔍 Giải thích kết quả Case 1:
* choice: "ke_toan": Trả về chính xác nhãn định tuyến dưới dạng chuỗi. Lập trình viên có thể dùng trực tiếp giá trị này trong mã nguồn logic (if/else) của hệ thống.
* probabilities: Nhãn mục tiêu "ke_toan" áp đảo tuyệt đối với xác suất xấp xỉ bằng 1.0 (gần như 100%).
type: "score")Gửi yêu cầu đánh giá sắc thái văn bản dựa trên thang điểm danh sách định sẵn (Mô hình sẽ chấm điểm chạy từ mức 0 tăng dần tương ứng theo vị trí phần tử trong mảng).
import requests
import json
url = "http://localhost:11434/v1/systemone"
payload = {
"model": "tranhuythang9999/clef-flash:latest",
"state": "Giao diện cập nhật mới nhìn rối mắt quá, tôi thích phiên bản cũ hơn.",
"questions": {
"muc_do_hai_long": {
"type": "score",
"instructions": "Hãy đánh giá mức độ hài lòng của khách hàng.",
"criteria": [
"Rất ghét, cực kỳ tiêu cực", # Mức 0
"Góp ý trung lập, không hài lòng nhẹ", # Mức 1
"Khen ngợi, tích cực" # Mức 2
]
}
}
}
response = requests.post(url, headers={"Content-Type": "application/json"}, data=json.dumps(payload))
print(json.dumps(response.json(), indent=2, ensure_ascii=False))
Kết quả trả về mẫu:
{
"model": "tranhuythang9999/clef-flash:latest",
"answers": {
"muc_do_hai_long": {
"type": "score",
"score": 0.9999999978126797,
"legend": {
"0": "Rất ghét, cực kỳ tiêu cực",
"1": "Góp ý trung lập, không hài lòng nhẹ",
"2": "Khen ngợi, tích cực"
},
"probabilities": {
"0": 3.9526604273332825e-09,
"1": 0.9999999942819995,
"2": 1.7653400696997487e-09
},
"confidence": 0.9999998927939964
}
},
"usage": {
"input_tokens": 130,
"output_tokens": 1
}
}
🔍 Giải thích kết quả Case 2:
* score: 0.9999...: Điểm số trung bình có trọng số hội tụ tuyệt đối về mức số 1. Khớp chính xác với mô tả "Góp ý trung lập, không hài lòng nhẹ" hiển thị trong bảng giải nghĩa legend.
* confidence: Độ tự tin đạt mức tối đa (~1.0), chứng tỏ mô hình phân loại sắc thái câu nói cực kỳ chuẩn xác và không hề bị phân vân.
usage)Trong cả 2 Case, thông số output_tokens đều bằng 1. Vì System One xử lý toán học trực tiếp trên xác suất phân loại thay vì sinh chuỗi văn bản tự do, tốc độ phản hồi được tối ưu xuống mức vài mili-giây, giúp tiết kiệm tài nguyên phần cứng vượt trội cho các hệ thống Automation lớn.
Nếu bạn muốn dùng mô hình để trò chuyện, sinh văn bản hoặc trả lời câu hỏi tự do như các mô hình ngôn ngữ thông thường:
Cài đặt thư viện: pip install ollama
import ollama
response = ollama.chat(
model='tranhuythang9999/clef-flash:latest',
messages=[
{'role': 'user', 'content': 'Xin chào! Bạn có thể giúp gì cho tôi?'},
]
)
print(response['message']['content'])
ollama run tranhuythang9999/clef-flash:latest