45 1 month ago

Contexto muy pequeño para agentes, SOLO chat. y 5 t/s en RTX 4060

vision tools thinking
ollama run aratan/qwen3.8

Applications

Claude Code
Claude Code ollama launch claude --model aratan/qwen3.8
OpenCode
OpenCode ollama launch opencode --model aratan/qwen3.8
Hermes Agent
Hermes Agent ollama launch hermes --model aratan/qwen3.8
OpenClaw
OpenClaw ollama launch openclaw --model aratan/qwen3.8

Models

View all →

1 model

qwen3.8:latest

18GB · 256K context window · Text, Image · 1 month ago

Readme

Basándome en la comparativa de datos facilitada, la evolución y las métricas directas entre los modelos analizados muestran el siguiente comportamiento:

Análisis de Rendimiento: Qwen3.6-27B vs. Qwen3.8-27B

El salto generacional de Qwen3.6-27B a Qwen3.8-27B dentro de la misma escala de parámetros (27B) evidencia mejoras sustanciales en todas las dimensiones evaluadas:

  • Programación Agéntica y Software Engineering: Es la disciplina donde la evolución es más drástica. En DeepSWE 1.1, Qwen3.8 sube a 42.2 frente a los 13.3 de Qwen3.6 (un incremento superior al 210%). Asimismo, en QwenSWEBench se observa un salto de 49.3 a 79.0, y en ejecución en terminal agéntico (Terminal Bench 2.1) sube de 63.4 a 73.0.
  • Capacidad Agéntica y Flujos de Larga Duración: En tareas agénticas complejas (Agents’ Last Exam), Qwen3.8 dobla prácticamente el desempeño en Pass@1 (20.4 vs. 10.6) y alcanza una puntuación general de 42.9 contra 27.3. En flujos de trabajo de oficina (CoWorkBench), mejora de 61.0 a 70.7.
  • Razonamiento General e Instrucciones: En IFBench se aprecia un incremento de 10.4 puntos (79.5 frente a 69.1), mientras que en pruebas de razonamiento científico (GPQA Diamond) e interdisciplinar (HLE) las ganancias son más moderadas pero sólidas (89.2 vs 87.8 y 30.8 vs 24.0 respectivamente).

Tabla Comparativa Directa

Categoría Benchmark Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus4.6 Max
Coding Terminal Bench 2.1 73.0 63.4 64.0 51.7 78.2
SWE-bench Pro 61.7 53.5 57.6 51.2 53.4
NL2Repo-Bench 42.3 36.2 41.1 47.6
DeepSWE 1.1 42.2 13.3 14.2
QwenSWEBench 79.0 49.3 59.2 63.8
Agent CoWorkBench 70.7 61.0 65.1 68.2
JobBench 33.4 21.8 27.6
Agents’ Last Exam (Score) 42.9 27.3 33.6
General IFBench 79.5 69.1 79.1 77.0 62.5
GPQA Diamond 89.2 87.8 90.3 83.5 91.3
HLE 30.8 24.0 34.7 22.0 40.0
LiveCodeBench v6 90.3 83.9 89.6 88.8

Posicionamiento respecto al resto del Benchmark

  • Vs. Qwen3.7-Plus: A pesar de ser una variante de mayor escala/infraestructura (API Plus), el nuevo peso abierto Qwen3.8-27B la supera holgadamente en la mayoría de métricas de código y capacidades agénticas (por ejemplo, en DeepSWE 1.1: 42.2 vs 14.2). *

  • Vs. Opus4.6 Max: Qwen3.8-27B se sitúa por encima del modelo propietario en benchmarks agénticos de desarrollo (SWE-bench Pro: 61.7 vs 53.4; QwenSWEBench: 79.0 vs 63.8; LiveCodeBench v6: 90.3 vs 88.8). Sin embargo, Opus4.6 Max mantiene el liderazgo en razonamiento abstracto (HLE: 40.0, GPQA: 91.3) y generación a nivel de repositorio completo (NL2Repo-Bench: 47.6).