2 yesterday

Fine-tuned vision-language model that reads photographed IDs, invoices, receipts, and certificates and returns clean structured JSON — 33 document types, 83% doc-type accuracy on held-out eval. Q4_K_M quantized for fast local inference.

vision