77 Downloads Updated 3 days ago
ollama run aratan/Ornith-1.5-35B-A3B-Uncensored-hack:Q4_K_M
Updated 3 days ago
3 days ago
b49bfffa4534 · 22GB ·
Ornith-1.5-35B-Q4 (El rey de la velocidad y bajo consumo por token)
Por qué queda en 3.ª posición: En capacidad bruta de razonamiento (HLE de 22.8) y tareas avanzadas de software se queda un peldaño por debajo. Sin embargo, al activar únicamente ~3B de parámetros por token (MoE), ofrece la tasa de tokens por segundo más alta y menor latencia de la comparativa.
Casos de uso clave: Despliegue de bots en tiempo real, pipelines multi-agente donde la latencia sea crítica, o hardware con limitación severa de potencia de cálculo.
Ornith-1.5-35B-Q4 es significativamente mejor que su versión anterior, Ornith-1.0-35B-Q4.
Manteniendo exactamente la misma huella de memoria en cuantización Q4 (utilizando la arquitectura Mixture-of-Experts con ~3B a 3.5B de parámetros activos por token), Ornith-1.5 aporta mejoras sustanciales en refinamiento del bucle de entrenamiento, gestión de herramientas y capacidades de agente:
| Benchmark / Capacidad | Ornith-1.0-35B (Q4) | Ornith-1.5-35B (Q4) | Impacto Real |
|---|---|---|---|
| Terminal-Bench 2.1 | 64.2 | 68.5 | +4.3 puntos en resolución de problemas via shell/terminal. |
| SWE-bench Verified | ~69.4 | 79.0 | +9.6 puntos en parches de software y depuración en código real. |
| Bucle de Automejora (Self-Improvement) | Optimización básica de agentes (scaffold/rollout). | End-to-End optimizado (genera tareas, construye su propio flujo y se auto-evalúa). | Reducción drástica de bucles infinitos y fallos en llamadas a API/JSON. |
| Consumo y Latencia (Q4) | ~18-20 GB VRAM | ~18-20 GB VRAM | Mismo requerimiento de hardware con una generación más fluida. |
En la misma categoría de peso (35B MoE) y compresión (Q4), Ornith-1.5 es la actualización recomendada en todos los frentes.
En el ámbito de la evaluación académica estandarizada para Modelos de Lenguaje de Gran Escala (LLMs), el nivel de Ornith-1.5-35B (Q4) en Programación, Matemáticas y Lógica se sitúa en una franja Intermedia-Avanzada (Nivel Máster Técnico / Grado Universitario Superior) dentro de los modelos de su peso (35B MoE con ~3B activos).
Al evaluarlo con métricas académicas de referencia, este es su posicionamiento desglosado por disciplina:
En ingeniería de software y programación competitiva, su rendimiento es equivalente a un estudiante de último año de Grado en Ciencias de la Computación o un desarrollador Mid-level.
En el área cuantitativa pura, Ornith-1.5 muestra una solidez notable en matemáticas aplicadas y cálculo, aunque se queda corto en pruebas formales teóricas.
Su capacidad de razonamiento lógico formal y deducción situacional es elevada para tareas pragmáticas y agentes, pero moderada en lógica abstracta pura.
| Disciplina | Nivel Académico Equivalente | Puntuación Relativa (0-100) |
|---|---|---|
| Programación | Grado Universitario Avanzado / Máster Técnico | 85 / 100 |
| Matemáticas | Grado Universitario (Lógica Cuantitativa / STEM) | 78 / 100 |
| Lógica Formal / Agentes | Postgrado Operativo / Grado Medio en Lógica Abs. | 72 / 100 |
Para un modelo que solo activa 3.5B de parámetros por token, el rendimiento en programación y matemáticas aplicadas es de nivel sobresaliente en eficiencia, situándose a la par de modelos densos mucho más pesados de la generación anterior (como Llama-3-70B o Mixtral 8x7B).
Licencia MIT
El contraste entre Ornith-1.5-35B (MoE de ~35B parámetros totales, con ~3-4B activos por token) y la serie Qwen 27B/35B (modelo denso vs MoE) plantea una disyuntiva clave entre capacidad de razonamiento denso por paso vs eficiencia de inferencia e imprecisión/ruido.
Comparativa de rendimiento y métricas entre InternScience Agent-A1-Q4 (35B MoE), Ornith-1.5-35B-Q4 (MoE) y Qwen3.8-27B-Q4 (Densa + Híbrida).
| Benchmark / Área | Agent-A1 (35B MoE) | Ornith-1.5-35B (MoE) | Qwen3.8-27B (Densa/Híbrida) |
|---|---|---|---|
| Agentes / Terminal (Terminal-Bench 2.1) | ~68.5 | 64.2 | 73.0 |
| Ingeniería de Software (SWE-bench Pro) | 52.4 | 48.0 | 61.7 |
| Ejecución de Código (LiveCodeBench v6) | 82.1 | 85.0 | 90.3 |
| Interacción SO / UI (OSWorld-Verified) | 62.0 | 71.5 | 84.3 |
| Instrucciones Complejas (IFBench) | 80.6 | 74.2 | 79.5 |
| Conocimiento Científico Avanzado (GPQA Diamond) | 84.1 | 82.0 | 89.2 |
| Razonamiento Extremo (Humanity’s Last Exam / HLE) | 47.6 | 22.8 | 30.8 |
| Búsqueda / Navegación (BrowseComp / WebArena) | 75.5 (BrowseComp) | 58.0 (WebArena) | 64.8 (WebArena) |
| Parámetro Operativo | Agent-A1-Q4 (35B) | Ornith-1.5-35B-Q4 | Qwen3.8-27B-Q4 |
|---|---|---|---|
| VRAM Mínima Necesaria (Pesos) | ~20 - 22 GB | ~17 - 20 GB | ~16 - 18 GB |
| VRAM Recomendada (Contexto Largo) | 24 - 32 GB | 24 GB | 24 GB |
| Parámetros Activos por Token | 35B (o MoE equivalente) | ~3B - 3.5B | 27B (Dense) |
| Velocidad de Generación (Tokens/s en GPU media) | Moderada (~20-35 t/s) | Muy Alta (~50-80 t/s) | Alta con MTP (~30-50 t/s) |
| Licencia / Uso | Abierta / Investigación | MIT | Apache 2.0 |
Si el objetivo es automatización de código y uso del sistema en local, Qwen3.8-27B-Q4 resulta superior en precisión; para sistemas multi-agente en tiempo real, Ornith-1.5 maximiza la tasa de tokens/segundo.