6 2 days ago

Mô hình clef-flash (6.8 GB) tối ưu riêng cho Ollama System One. Chuyên phân loại, chấm điểm, ra quyết định Đúng/Sai siêu tốc qua cấu trúc JSON chỉ với 1 output token.

vision
ollama run tranhuythang9999/clef-flash

Details

2 days ago

1693cb57551d · 6.8GB

qwen35
·
8.95B
·
Q4_K_M
clip
·
456M
·
F16

Readme

clef-flash (by @tranhuythang9999)

Mô hình clef-flash:latest là phiên bản tối ưu hóa hiệu năng cao, dung lượng 6.8 GB, hỗ trợ xử lý ngữ cảnh nhanh (flash-attention) và tương thích hoàn toàn với các tính năng thế hệ mới của Ollama, đặc biệt là điểm cuối cấu trúc Ollama System One.

🚀 Tính năng nổi bật: Ollama System One (Python)

Yêu cầu Ollama phiên bản v0.35.0 trở lên.

Tính năng này ép mô hình xử lý toán học trực tiếp trên xác suất phân loại để trả về cấu trúc định dạng JSON siêu tốc. Kết quả đầu ra chỉ tiêu tốn đúng 1 output token, giúp loại bỏ hoàn toàn các văn bản thừa và tiết kiệm tài nguyên hệ thống tối đa.

🔹 CASE 1: Phân loại / Điều hướng dữ liệu (type: "choice")

Tự động nhận diện nội dung văn bản để điều hướng (Routing) công việc về đúng bộ phận xử lý mà không cần viết hàm bóc tách dữ liệu phức tạp.

import requests
import json

url = "http://localhost:11434/v1/systemone"
payload = {
    "model": "tranhuythang9999/clef-flash:latest",
    "state": "Hệ thống thanh toán lỗi, tôi bị trừ tiền 2 lần!",
    "questions": {
        "phong_ban": {
            "type": "choice",
            "instructions": "Phân loại yêu cầu này thuộc phòng ban nào xử lý?",
            "criteria": {
                "ky_thuat": "Lỗi phần mềm, bug hệ thống, không kết nối được",
                "ke_toan": "Vấn đề tiền bạc, hóa đơn, hoàn tiền, thanh toán"
            }
        }
    }
}

response = requests.post(url, headers={"Content-Type": "application/json"}, data=json.dumps(payload))
print(json.dumps(response.json(), indent=2, ensure_ascii=False))

Kết quả trả về mẫu:

{
  "model": "tranhuythang9999/clef-flash:latest",
  "answers": {
    "phong_ban": {
      "type": "choice",
      "choice": "ke_toan",
      "probabilities": {
        "ky_thuat": 4.548642073805983e-13,
        "ke_toan": 0.999999999999545
      },
      "confidence": 0.9999999999806943
    }
  },
  "usage": {
    "input_tokens": 122,
    "output_tokens": 1
  }
}

🔍 Giải thích kết quả Case 1: * choice: "ke_toan": Trả về chính xác nhãn định tuyến dưới dạng chuỗi. Lập trình viên có thể dùng trực tiếp giá trị này trong mã nguồn logic (if/else) của hệ thống. * probabilities: Nhãn mục tiêu "ke_toan" áp đảo tuyệt đối với xác suất xấp xỉ bằng 1.0 (gần như 100%).


🔹 CASE 2: Chấm điểm sắc thái phân cấp (type: "score")

Gửi yêu cầu đánh giá sắc thái văn bản dựa trên thang điểm danh sách định sẵn (Mô hình sẽ chấm điểm chạy từ mức 0 tăng dần tương ứng theo vị trí phần tử trong mảng).

import requests
import json

url = "http://localhost:11434/v1/systemone"
payload = {
    "model": "tranhuythang9999/clef-flash:latest",
    "state": "Giao diện cập nhật mới nhìn rối mắt quá, tôi thích phiên bản cũ hơn.",
    "questions": {
        "muc_do_hai_long": {
            "type": "score",
            "instructions": "Hãy đánh giá mức độ hài lòng của khách hàng.",
            "criteria": [
                "Rất ghét, cực kỳ tiêu cực",         # Mức 0
                "Góp ý trung lập, không hài lòng nhẹ", # Mức 1
                "Khen ngợi, tích cực"                 # Mức 2
            ]
        }
    }
}

response = requests.post(url, headers={"Content-Type": "application/json"}, data=json.dumps(payload))
print(json.dumps(response.json(), indent=2, ensure_ascii=False))

Kết quả trả về mẫu:

{
  "model": "tranhuythang9999/clef-flash:latest",
  "answers": {
    "muc_do_hai_long": {
      "type": "score",
      "score": 0.9999999978126797,
      "legend": {
        "0": "Rất ghét, cực kỳ tiêu cực",
        "1": "Góp ý trung lập, không hài lòng nhẹ",
        "2": "Khen ngợi, tích cực"
      },
      "probabilities": {
        "0": 3.9526604273332825e-09,
        "1": 0.9999999942819995,
        "2": 1.7653400696997487e-09
      },
      "confidence": 0.9999998927939964
    }
  },
  "usage": {
    "input_tokens": 130,
    "output_tokens": 1
  }
}

🔍 Giải thích kết quả Case 2: * score: 0.9999...: Điểm số trung bình có trọng số hội tụ tuyệt đối về mức số 1. Khớp chính xác với mô tả "Góp ý trung lập, không hài lòng nhẹ" hiển thị trong bảng giải nghĩa legend. * confidence: Độ tự tin đạt mức tối đa (~1.0), chứng tỏ mô hình phân loại sắc thái câu nói cực kỳ chuẩn xác và không hề bị phân vân.


💡 Điểm vượt trội về hiệu năng sử dụng (usage)

Trong cả 2 Case, thông số output_tokens đều bằng 1. Vì System One xử lý toán học trực tiếp trên xác suất phân loại thay vì sinh chuỗi văn bản tự do, tốc độ phản hồi được tối ưu xuống mức vài mili-giây, giúp tiết kiệm tài nguyên phần cứng vượt trội cho các hệ thống Automation lớn.


💬 Cách sử dụng Chat API thông thường (Python)

Nếu bạn muốn dùng mô hình để trò chuyện, sinh văn bản hoặc trả lời câu hỏi tự do như các mô hình ngôn ngữ thông thường:

Cài đặt thư viện: pip install ollama

import ollama

response = ollama.chat(
    model='tranhuythang9999/clef-flash:latest',
    messages=[
        {'role': 'user', 'content': 'Xin chào! Bạn có thể giúp gì cho tôi?'},
    ]
)
print(response['message']['content'])

📊 Hướng dẫn chạy nhanh trên máy & Thông số kỹ thuật

Tải và chạy trực tiếp bằng Terminal

ollama run tranhuythang9999/clef-flash:latest

Thông số kỹ thuật

  • Kích thước mô hình (Size): ~6.8 GB
  • Bộ nhớ khuyến nghị (VRAM/RAM): Tối thiểu 8GB (Chạy mượt nhất trên GPU)
  • Chiều dài ngữ cảnh (Context Window): 4096 tokens
  • Định dạng dữ liệu đầu ra thích hợp: Văn bản tự do (Chat), JSON có cấu trúc (System One)