77 3 days ago

Linux CarchyOS

vision tools
ollama run aratan/Ornith-1.5-35B-A3B-Uncensored-hack:Q4_K_M

Details

3 days ago

b49bfffa4534 · 22GB ·

qwen35moe
·
35.5B
·
Q4_K_M
clip
·
447M
·
Q8_0
[{"role":"user","content":"hola"},{"role":"assistant","content":"¡Hola! 👋 ¿Cómo estás? ¿En q
{{- if .System }}<|im_start|>system {{ .System }}<|im_end|> {{- end }} {{- if .Tools }}<|im_start|>s
Verificación de Memoria Persistente: 1. Comprueba si existe `./PROCESS.md`. Si no existe, créalo p
{ "num_ctx": 32768, "stop": [ "<|im_start|>", "<|im_end|>", "<tool_c

Readme

Ornith-1.5-35B-Q4 (El rey de la velocidad y bajo consumo por token)

Por qué queda en 3.ª posición: En capacidad bruta de razonamiento (HLE de 22.8) y tareas avanzadas de software se queda un peldaño por debajo. Sin embargo, al activar únicamente ~3B de parámetros por token (MoE), ofrece la tasa de tokens por segundo más alta y menor latencia de la comparativa.

Casos de uso clave: Despliegue de bots en tiempo real, pipelines multi-agente donde la latencia sea crítica, o hardware con limitación severa de potencia de cálculo.

Ornith-1.5-35B-Q4 es significativamente mejor que su versión anterior, Ornith-1.0-35B-Q4.

Manteniendo exactamente la misma huella de memoria en cuantización Q4 (utilizando la arquitectura Mixture-of-Experts con ~3B a 3.5B de parámetros activos por token), Ornith-1.5 aporta mejoras sustanciales en refinamiento del bucle de entrenamiento, gestión de herramientas y capacidades de agente:

Comparativa de Métricas Directas

Benchmark / Capacidad Ornith-1.0-35B (Q4) Ornith-1.5-35B (Q4) Impacto Real
Terminal-Bench 2.1 64.2 68.5 +4.3 puntos en resolución de problemas via shell/terminal.
SWE-bench Verified ~69.4 79.0 +9.6 puntos en parches de software y depuración en código real.
Bucle de Automejora (Self-Improvement) Optimización básica de agentes (scaffold/rollout). End-to-End optimizado (genera tareas, construye su propio flujo y se auto-evalúa). Reducción drástica de bucles infinitos y fallos en llamadas a API/JSON.
Consumo y Latencia (Q4) ~18-20 GB VRAM ~18-20 GB VRAM Mismo requerimiento de hardware con una generación más fluida.

¿Por qué la versión 1.5 supera a la 1.0?

  1. Mayor disciplina en uso de herramientas (Tool Calling): La versión 1.0 tendía a emitir texto plano cuando se enfrentaba a tareas ambiguas en lugar de invocar funciones o herramientas estructuradas. La versión 1.5 resuelve esto forzando una sintaxis limpia incluso bajo contextos cargados.
  2. Optimización de contexto largo: Ornith-1.5 retiene mejor los parámetros del entorno cuando las trazas del agente superan los 30K-40K tokens, mientras que la 1.0 sufría de cierta degradación progresiva de atención.
  3. Mismo coste computacional: No hay penalización de hardware. Ambos modelos operan activando solo ~3B de parámetros, manteniendo la tasa de rendimiento alta (~50-80 t/s según la GPU).

En la misma categoría de peso (35B MoE) y compresión (Q4), Ornith-1.5 es la actualización recomendada en todos los frentes.

En el ámbito de la evaluación académica estandarizada para Modelos de Lenguaje de Gran Escala (LLMs), el nivel de Ornith-1.5-35B (Q4) en Programación, Matemáticas y Lógica se sitúa en una franja Intermedia-Avanzada (Nivel Máster Técnico / Grado Universitario Superior) dentro de los modelos de su peso (35B MoE con ~3B activos).

Al evaluarlo con métricas académicas de referencia, este es su posicionamiento desglosado por disciplina:


1. Programación: Nivel Universitario Avanzado / Desarrollador Mid-Senior

En ingeniería de software y programación competitiva, su rendimiento es equivalente a un estudiante de último año de Grado en Ciencias de la Computación o un desarrollador Mid-level.

  • SWE-bench Verified (~79.0%): Capacidad muy alta para analizar repositorios reales de código en Python/C++/Go, comprender issues complejas y aplicar parches correctivos limpios.
  • LiveCodeBench / HumanEval (>85%): Excelente precisión en sintaxis, estructuras de datos, algoritmos de ordenación/búsqueda y resolución de problemas algorítmicos puros sin efectos secundarios.
  • Fortaleza: Destaca en la escritura de scripts de automatización, parsing de sintaxis y generación de código funcional rápido.
  • Debilidad: En arquitecturas de software distribuidas o refactorización masiva de repositorios multi-lenguaje, puede cometer pequeñas omisiones de contexto que requieren supervisión.

2. Matemáticas: Nivel Grado Universitario (Matemáticas Aplicadas)

En el área cuantitativa pura, Ornith-1.5 muestra una solidez notable en matemáticas aplicadas y cálculo, aunque se queda corto en pruebas formales teóricas.

  • MATH Benchmark (~72% - 76%): Resuelve problemas de álgebra avanzada, cálculo diferencial/integral, probabilidad y combinatoria equivalentes al primer/segundo año de carreras STEM.
  • GSM8K (>92%): Dominio prácticamente absoluto de la resolución de problemas matemáticos narrativos y razonamiento aritmético multi-paso.
  • Fortaleza: Sobresaliente ejecutando operaciones algebraicas paso a paso cuando se le fuerza a razonar vía Chain-of-Thought (CoT).
  • Debilidad: Falla en la demostración axiomática pura (demostración de teoremas abstractos de nivel doctorado/investigación) y en problemas que requieren invención de nuevos conceptos matemáticos.

3. Lógica y Razonamiento: Nivel Postgrado Técnico (Con limitaciones en casos límite)

Su capacidad de razonamiento lógico formal y deducción situacional es elevada para tareas pragmáticas y agentes, pero moderada en lógica abstracta pura.

  • ARC-Challenge / MMLU-Pro (~75% - 80% en subsecciones de lógica): Capacidad analítica sólida para deducción silogística, análisis de patrones lógicos e inferencia de datos no estructurados.
  • Humanity’s Last Exam (HLE) (~22.8%): Es su métrica más reveladora. HLE evalúa razonamiento en el límite del conocimiento humano (nivel investigativo/Doctorado). Un 22.8% indica que, ante acertijos lógicos hiper-complejos o trampas conceptuales cruzadas, el modelo colapsa frente a arquitecturas densas como Agent-A1 o Qwen3.8.
  • Fortaleza: Lógica procedimental, ejecución de instrucciones condicionales complejas y toma de decisiones en bucles de agentes.
  • Debilidad: Vulnerable a razonamientos contraintuitivos o problemas lógicos que requieren romper patrones de su corpus de entrenamiento.

Resumen de Nivel Académico

Disciplina Nivel Académico Equivalente Puntuación Relativa (0-100)
Programación Grado Universitario Avanzado / Máster Técnico 85 / 100
Matemáticas Grado Universitario (Lógica Cuantitativa / STEM) 78 / 100
Lógica Formal / Agentes Postgrado Operativo / Grado Medio en Lógica Abs. 72 / 100

Para un modelo que solo activa 3.5B de parámetros por token, el rendimiento en programación y matemáticas aplicadas es de nivel sobresaliente en eficiencia, situándose a la par de modelos densos mucho más pesados de la generación anterior (como Llama-3-70B o Mixtral 8x7B).

Licencia MIT

El contraste entre Ornith-1.5-35B (MoE de ~35B parámetros totales, con ~3-4B activos por token) y la serie Qwen 27B/35B (modelo denso vs MoE) plantea una disyuntiva clave entre capacidad de razonamiento denso por paso vs eficiencia de inferencia e imprecisión/ruido.


Comparativa de rendimiento y métricas entre InternScience Agent-A1-Q4 (35B MoE), Ornith-1.5-35B-Q4 (MoE) y Qwen3.8-27B-Q4 (Densa + Híbrida).


Perfil y Arquitectura

  • InternScience Agent-A1 (35B MoE): Especializado en la ejecución de agentes de trayectoria extendida (long-horizon). Diseñado para mantener coherencia contextualmente extensa (45K+ tokens promedio en la traza de ejecución) y orquestación de herramientas sin degradación.
  • Ornith-1.5-35B (MoE - 3B Activos): Evolución sobre la arquitectura Qwen3.5 MoE entrenada mediante self-improvement. Destaca por un throughput alto de generación/prefill con un consumo de VRAM reducido y soporte multimodal nativo.
  • Qwen3.8-27B (Densa / Híbrida Gated DeltaNet): Modelo denso de 27B con arquitectura de atención híbrida (48 capas DeltaNet + 16 capas Full Attention) y un MTP (Multi-Token Prediction) Head nativo. Optimizado para entornos locales monogpu con ventana de contexto de 262K.

Comparativa de Métricas (Benchmarks Clave)

Benchmark / Área Agent-A1 (35B MoE) Ornith-1.5-35B (MoE) Qwen3.8-27B (Densa/Híbrida)
Agentes / Terminal (Terminal-Bench 2.1) ~68.5 64.2 73.0
Ingeniería de Software (SWE-bench Pro) 52.4 48.0 61.7
Ejecución de Código (LiveCodeBench v6) 82.1 85.0 90.3
Interacción SO / UI (OSWorld-Verified) 62.0 71.5 84.3
Instrucciones Complejas (IFBench) 80.6 74.2 79.5
Conocimiento Científico Avanzado (GPQA Diamond) 84.1 82.0 89.2
Razonamiento Extremo (Humanity’s Last Exam / HLE) 47.6 22.8 30.8
Búsqueda / Navegación (BrowseComp / WebArena) 75.5 (BrowseComp) 58.0 (WebArena) 64.8 (WebArena)

Recursos y Comportamiento In-ference en Quant Q4

Parámetro Operativo Agent-A1-Q4 (35B) Ornith-1.5-35B-Q4 Qwen3.8-27B-Q4
VRAM Mínima Necesaria (Pesos) ~20 - 22 GB ~17 - 20 GB ~16 - 18 GB
VRAM Recomendada (Contexto Largo) 24 - 32 GB 24 GB 24 GB
Parámetros Activos por Token 35B (o MoE equivalente) ~3B - 3.5B 27B (Dense)
Velocidad de Generación (Tokens/s en GPU media) Moderada (~20-35 t/s) Muy Alta (~50-80 t/s) Alta con MTP (~30-50 t/s)
Licencia / Uso Abierta / Investigación MIT Apache 2.0

Análisis Táctico y Conclusiones

  • Rendimiento General y Herramientas (Dominio Local): Qwen3.8-27B-Q4 lidera en la mayoría de benchmarks directos de código (SWE-bench, LiveCodeBench) e interacción con interfaces (OSWorld). La inclusión de la capa de atención Gated DeltaNet permite procesar contextos de hasta 262K tokens con menor costo computacional que los transformadores densos tradicionales.
  • Eficiencia e Inferencia Rápida: Ornith-1.5-35B-Q4 ofrece el mayor rendimiento en velocidad (decode/prefill throughput) gracias a su baja activación por token (~3B activos). Es la mejor opción para despliegues con restricciones de potencia de cálculo donde la latencia sea crítica.
  • Razonamiento en Misiones Complejas Multi-paso: Agent-A1-Q4 destaca en Humanity’s Last Exam (HLE) y tareas que exigen mantener el contexto a través de decenas de miles de tokens sin perder la coherencia instruccional (agent horizon).

Si el objetivo es automatización de código y uso del sistema en local, Qwen3.8-27B-Q4 resulta superior en precisión; para sistemas multi-agente en tiempo real, Ornith-1.5 maximiza la tasa de tokens/segundo.