45 Downloads Updated 1 month ago
ollama run aratan/qwen3.8
ollama launch claude --model aratan/qwen3.8
ollama launch opencode --model aratan/qwen3.8
ollama launch hermes --model aratan/qwen3.8
ollama launch openclaw --model aratan/qwen3.8
Basándome en la comparativa de datos facilitada, la evolución y las métricas directas entre los modelos analizados muestran el siguiente comportamiento:
El salto generacional de Qwen3.6-27B a Qwen3.8-27B dentro de la misma escala de parámetros (27B) evidencia mejoras sustanciales en todas las dimensiones evaluadas:
| Categoría | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|---|
| Coding | Terminal Bench 2.1 | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 | |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | — | 47.6 | |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | — | — | |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | — | 63.8 | |
| Agent | CoWorkBench | 70.7 | 61.0 | 65.1 | — | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | — | — | |
| Agents’ Last Exam (Score) | 42.9 | 27.3 | 33.6 | — | — | |
| General | IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 | |
| HLE | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 | |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | — | 88.8 |
Vs. Qwen3.7-Plus: A pesar de ser una variante de mayor escala/infraestructura (API Plus), el nuevo peso abierto Qwen3.8-27B la supera holgadamente en la mayoría de métricas de código y capacidades agénticas (por ejemplo, en DeepSWE 1.1: 42.2 vs 14.2). *
Vs. Opus4.6 Max: Qwen3.8-27B se sitúa por encima del modelo propietario en benchmarks agénticos de desarrollo (SWE-bench Pro: 61.7 vs 53.4; QwenSWEBench: 79.0 vs 63.8; LiveCodeBench v6: 90.3 vs 88.8). Sin embargo, Opus4.6 Max mantiene el liderazgo en razonamiento abstracto (HLE: 40.0, GPQA: 91.3) y generación a nivel de repositorio completo (NL2Repo-Bench: 47.6).