Models
Docs
Pricing
Sign in
Download
Models
Download
Docs
Pricing
Sign in
AZERDSQ
/
g2-nano-instruct
:latest
Updated
45 minutes ago
A 60M-parameter GPT trained from scratch on a single 8GB Jetson (3B tokens), then instruction-tuned. SFT lowers mean_7 vs the base (40.16% vs 42.13%). Not an upgrade over g1-nano-instruct.
A 60M-parameter GPT trained from scratch on a single 8GB Jetson (3B tokens), then instruction-tuned. SFT lowers mean_7 vs the base (40.16% vs 42.13%). Not an upgrade over g1-nano-instruct.
Cancel
g2-nano-instruct:latest
...
/
template
ffc37f014cf7 · 41B
<|user|>{{ .Prompt }}<|end|><|assistant|>