4 1 week ago

On-Prem Document-AI für Schweizer Belege & QR-Rechnungen (DE/FR/IT) — 84.7 % Field-EM, 0 % Halluzination. Von den Machern von German-OCR.

vision
ollama run Keyvan/belegant-4b

Models

View all →

1 model

belegant-4b:latest

3.5GB · 256K context window · Text, Image · 1 week ago

Readme

Belegant-4B

🇨🇭 Schweiz · 🇩🇪 DE · 🇫🇷 FR · 🇮🇹 IT · 🇦🇹 AT

On-Prem Document-AI für Schweizer Belege & QR-Rechnungen. Extrahiert IBAN, Betrag, MWST und Positionen aus einem Beleg-Bild und prüft jedes Feld deterministisch mit der Prüfschicht belegant-verify. Läuft lokal beim Kunden — keine Cloud, kein Datenabfluss. Von den Machern von German-OCR.

  • 84.7 % Field-EM (BelegBench v1)
  • 0 % Halluzination auf validierten Feldern
  • ~3 s pro Beleg · lokal · DE / FR / IT
  • Basis: Qwen3.5-4B (Apache-2.0)

Schnellstart

ollama run Keyvan/belegant-4b "Extrahiere alle Felder dieses Belegs als striktes JSON." ./rechnung.png

Was ist Belegant-4B

Belegant-4B extrahiert aus dem Bild einer Schweizer Rechnung strukturierte, geprüfte Felder — Empfänger, IBAN, Betrag, Referenz, Positionen, MWST-Aufschlüsselung, Fälligkeiten — als striktes JSON.

Der Unterschied zu reiner Bild-Extraktion: Belegant vertraut dem Modell nicht blind. Jedes Feld läuft durch eine deterministische Prüfschicht (belegant-verify) und wird gegen den konventionell dekodierten Swiss-QR-Code abgeglichen. Was einen Check nicht besteht, wird geflaggt — nie still ausgegeben. Ergebnis: 0 % Halluzination auf validierten Feldern. Lieber ein ehrliches null als eine erfundene IBAN. Für Treuhänder mit Berufsgeheimnis ist genau das der Kaufgrund.

Deterministische Prüfungen (belegant-verify)

  • QR-Oracle: Swiss-QR-Payload wird konventionell dekodiert; Zahlfelder (IBAN, Betrag, Währung, Referenz) autoritativ übernommen statt geraten.
  • IBAN / QR-IBAN (mod-97, QR-IID-Bereich 30000–31999)
  • QR-Referenz (Modulo-10 rekursiv), Creditor Reference (ISO 11649 / SCOR)
  • MWST-Arithmetik (8.1 % / 2.6 % / 3.8 %, Netto + Steuer = Brutto)
  • CHE-UID (mod-11), Swico-S1-Parser, CH-Formate (Apostroph-Tausender, 4-stellige PLZ, kein „ß”)

BelegBench v1 — fairer 4B-Vergleich (n = 300, 100 % synthetisch, DE/FR/IT)

Modell Grösse Field-EM Halluzinationsrate Parse-Fehler
Belegant-4B 4B 84.7 % 0.0 % 3300
Qwen3.5-4B (Basis, roh) 4B 75.8 % 1.2 % 15100
gemma3:4b (roh) 4B 16.5 % 15.9 % 76100

Trilingual: DE 84.7 % · FR 81.4 % · IT 83.0 % — je 0 % Halluzination.

+9 Punkte über der rohen Qwen3.5-4B-Basis und als einziges Modell mit 0 % Halluzination (die Treuhänder-Metrik), bei ~3 s pro Beleg, lokal, auf einem 4B. Die deterministische Prüfschicht fing 75 % der Fehler auf prüfbaren Feldern ab.

Datenschutz & Compliance

  • On-Prem: Belege verlassen nie das Haus — der Kunde bleibt Verantwortlicher (revDSG / DSGVO).
  • Training auf 100 % synthetischen Daten → 0 % Kundendaten im Modell.

Credits & Danksagung

Basiert auf Qwen3.5-4B von Alibaba Cloud · Qwen Team (Apache-2.0) — grosser Dank ans Qwen-Team für das offene, starke Basismodell. Belegant fügt die Schweizer Extraktions- und deterministische Prüfschicht (belegant-verify) hinzu.

Links

Lizenz

Apache-2.0 (Modell-Gewichte, BelegBench, belegant-verify Basic). Konnektoren, volle Validator-Suite und Support: Belegant Pro (On-Prem-Lizenz).