
Auto-Andamiaje (Self-Scaffolding): Cuando se enfrenta a un servicio no documentado, es capaz de orquestar un plan de reconocimiento (recon -> enumeración -> identificación de versión -> prueba de concepto).


Resumen de Equivalencia
En programación/agentes (CLI, Git, Terminal): Equiparable a ### Claude 3.5 / 3.7 Sonnet.
En chat general / tareas variadas de texto: Equiparable a la franja de **GPT-4o mini o Gemini 1.5 Flash**, ya que la mayor parte de su ajuste de refuerzo (RL) está especializada en
** Config optima: **
max_new_tokens=512,
do_sample=True,
temperature=0.6,
top_p=0.95,
top_k=20,
El Ornith-1.0-35B (lanzado por DeepReinforce) se ha posicionado en el ecosistema de IA local como un modelo de programación agéntica súper optimizado, diseñado específicamente para ser ejecutado en una sola GPU de consumo o estación de trabajo.
1. Características Técnicas en Local
Arquitectura MoE (Mixture of Experts): Es un modelo basado en post-entrenamiento de Qwen 3.5 / Gemma 4, con 35B parámetros totales, pero que solo activa ~3B de parámetros por token en tiempo de inferencia.
Licencia: MIT (100% abierto, comercial e ilimitado).
Entrenamiento de Auto-Andamiaje (Self-Scaffolding RL): A diferencia de modelos que necesitan un arnés rígido creado por humanos, Ornith aprendió mediante aprendizaje por refuerzo a estructurar sus propios planes de acción, herramientas y lógica de verificación antes de tocar el código.
Consumo de Memoria (VRAM/RAM):
GGUF Q8 / FP16: Requiere entre 37 GB y 40 GB de VRAM (ideal para GPUs tipo A6000, H100 o configuraciones Dual RTX 3090⁄4090).
GGUF Q4 / MXFP4 / NVFP4: Ocupa ~21 GB - 24 GB en disco/VRAM, lo que permite ejecutarlo con holgura en una sola RTX 3090, 4090 o Mac Apple Silicon de 32GB+.
Ventaja de Velocidad: Al razonar activando solo 3B de parámetros, genera Chain of Thought (pensamiento previo) mucho más sintético, alcanzando hasta 3x la velocidad de generación frente a modelos densos de 35B.
2. Modelos Conocidos a los que Supera
En benchmarks de codificación agéntica (como Terminal-Bench 2.1, SWE-Bench Verified, SWE-bench Pro y NL2Repo):
- Supera holgadamente: A Gemma 4 31B y a la base Qwen 3.5 35B.
- Bate o empata: A Qwen 3.6 35B-A3B en corrección de bugs y ejecución de terminal, e incluso llega a superar en tareas agénticas de terminal a modelos masivos como Qwen 3.5 397B (10 veces más grande) gracias a la especialización de sus pesos.
3. ¿En qué es MUY Bueno? (Pros)
- Depuración Multi-Archivo y Refactorización SQL: Es excelente detectando cuellos de botella lógicos complejos (como subconsultas correlacionadas redundantes en SQL o errores cruzados entre backend/frontend).
- Uso de Herramientas (Tool-Calling) e Integración Agéntica: Funciona impecablemente en combinación con CLI agénticos locales como Hermes Agent, OpenCode, Aider o Codex-CLI.
- Cadenas de Razonamiento Eficientes: No se pierde en reflexiones o soliloquios interminables antes de actuar; va directo a la ejecución del diff o del comando de consola.
- Bajo Impacto Térmico y Energético: En local consume una fracción del cómputo de otros 35B densos.
4. ¿En qué NO es tan bueno? (Contras)
- Generación de UI / Gráficos Canvas desde Cero: Falla notablemente si se le pide generar interfaces visuales pesadas o simulación matemática en un único archivo (ej. animaciones complejas en HTML5 Canvas sin librerías).
- Navegación Web / Planes de Navegador (Browser Agent): Aunque es superior en terminal, en benchmarks de control de navegador (WebBrain) se queda por detrás de modelos generales como Gemma 4 31B.
- Procesamiento de Documentos Generalistas: No es un modelo para redactar ensayos, resúmenes creativos ni traducción; su alineación está hiperespecializada en sintaxis y lógica de software.
5. Casos de Éxito vs. Casos donde Falla (¿Para qué usarlo y para qué no?)
✅ Casos de Éxito (Uso recomendado)
- Asistente de Terminal y Agente CLI Local: Diagnosticar entornos Linux, arreglar scripts de despliegue, automatizar flujos de trabajo en bash/python.
- Corrección de Bugs en Proyectos Existentes (SWE Tasks): Rastrear y reparar fallos silenciosos pasando un conjunto de tests en repositorios de tamaño medio (C++, Python, TypeScript, Go).
- Generación y Optimización de Consultas DB: Reescribir consultas SQL lentas y estructurar schemas.
- Desarrollo Greenfield de Microservicios: Crear APIs REST, endpoints o scripts aislados desde cero.
❌ Dónde da fallos y NO debería usarse
- Edición Libre sin Restricciones en Repositorios Gigantes: Si se le da un agente con permiso de escritura total sin restricciones, el modelo tiene tendencia a aplicar refactorizaciones no solicitadas o eliminar bloques que no le dijiste que modificara.
- Mitigación: Usar siempre en modo planificación (plan mode) o revisando el
git diff antes de aplicar los cambios.
- Generación de Arte Generativo / Canvas en Frontend: No usar para maquetar juegos 2D interactivos o gráficos procedimentales sin un framework de respaldo.
- Automatización de Navegador Web (Browser Scraping complejo): Para guiar un headless browser realizando clics y navegando por la web, es mejor optar por un modelo de propósito general.