58 Downloads Updated 1 week ago
ollama run aratan/Qwable-agent-9B-Claude-Fable-5-heretic-GGUF:Q6_K
El mismo arnés. El mismo muestreo. Las mismas indicaciones. Las victorias son reales. Tarea Métrica Base Qwen3.5-9B ¿Qwythos-9B Δ gsm8k exact_match (flexible) 0.670 0.860 +0.190 gsm8k exact_match (estricto) 0.510 0.810 +0.300 mmlu Acc 0.232 0.575 +0.343 Arc_challenge Acc 0.470 0.490 +0.020 Arc_challenge acc_norm 0.400 0.410 +0.010 gpqa_diamond (CoT, 0-shot) exact_match (flexible) 0.630 0.580 −0.050
Todos los números producidos con lm-evaluation-harness, HF backend, –apply_chat_template, Qwen3.5 muestreo (temperature=0.6, top_p=0.95, top_k=20), –limit 100. Desglose completo por tarea y por sujeto (MMLU) en evals/lm_evalresults.md. ¿Rudo results*.jsony por-muestra samples*.jsonlEstán disponibles bajo petición.
El levantamiento MMLU +34.3 es el titular. Qwythos publica 0.575 medias en las 57 asignaturas, alcanzando su punto máximo en 0,78 en el gobierno/política, 0.77 en biología universitaria, 0.74 en física conceptual, lo que lo coloca muy por encima de lo que la mayoría de los modelos de razonamiento 9B ofrecen en las mismas condiciones de evaluación. Los números absolutos de MMLU para cualquier modelo 9B son sensibles al arnés, el recuento de pocos disparos y el manejo de la plantilla de chat; lo que importa en esta comparación es que ambos modelos fueron evaluados con configuraciones idénticas. Capacidad: Uso de herramientas nativas con autocorrección
Qwythos admite la función de estilo OpenAI/Qwen3.5 llamando fuera de la caja, sin envoltura adicional, sin necesidad de ajustar las herramientas. Pase tools=[…]A la plantilla de chat y el modelo emite válido Bloques según la especificación de Qwen3.5, con los parámetros requeridos honrados.
Evaluamos el uso de la herramienta en un arnés de 7 salidas que combina demostraciones de capacidad con indicaciones de retirada de hechos deliberadamente duras donde falla el muestreo de libro cerrado: Prompt Herramienta seleccionada Resultado Computar sin(π/7) × cos(π/11)a 10 dp python_executor ✅ 0.4163083990(correcto, llamada única) Cuenta los primos por debajo de 100.000 python_executor ✅ 9592(corrige, escribe y realiza un tamiz) Última versión estable de CPython 3 web_search ✅ Encontrado 3.14.6 (junio de 2026), 3.15 en beta, fuente citada Modo Hashcat para Kerberos TGS-REP web_search ✅ -m 13100Con 4 fuentes corroborativas CVE para impresiónPesaña web_search ✅ (y se distingue correctamente de las variantes CVE-2021-1675 / CVE-2021-34481) ¿Está indicada la fisostigmina para la intoxicación por organofosfato? web_search ✅ Citó la toxicología de LITFL. Sitio de escisión DPP-4 en modificación de GLP-1 / semaglutida web_search ✅ — citado Wikipedia y fuente farmacéutica
7 de 7 lo han conseguido. La selección de herramientas siempre fue sensata (matemáticas → Python; hechos → búsqueda). Las cuatro filas inferiores son particularmente importantes: son los cuatro hechos de especialidad más difíciles de recordar el libro cerrado, y Qwythos, dadas las herramientas adecuadas, buscadas, fuentes múltiples integradas y respuestas correctas citadas por la fuente en cada caso.
Transcripciones completas con el razonamiento del modelo, cada llamada de herramienta emitida, cada resultado devuelto y la respuesta integrada final están en evals/tool_test_outputs.md.
Esto hace que Qwythos esté listo para la implementación de la configuración de agentes aumentados de recuperación, donde el modelo verifica sus detalles en lugar de fabricarlos. Capacidad: ventana de contexto de 1.048,576-token
Qwythos envía con escalado de cuerda YaRN configurado por defecto para una ventana de contexto de 1.048,576 tokens (≈1M): una extensión de 4 × sobre la arquitectura nativa de 262,144 tokens. La configuración se hornea en config.jsony se aplica automáticamente en el tiempo de carga; no se requiere bandera separada, paso de post-procesamiento o tokenizador específico de YaRN:
“rope_parameters”: { “rope_type”: “yarn”, “factor”: 4.0, “original_max_position_embeddings”: 262144, “mrope_interleaved”: true, “mrope_section”: [11, 11, 10], “rope_theta”: 10000000 }, “max_position_embeddings”: 1048576
Esta es la receta oficial de Qwen3.5 para el contexto de 1M, que coincide con la configuración documentada en la propia tarjeta modelo de Qwen y las recetas de implementación Árbol modelo para Empero-ai/Qwythos-9B-Claude-Mythos-5-1M
Modelo base Base Qwen/Qwen3.5-9B-B Afinado Qwen/Qwen3.5-9B
https://huggingface.co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M