1,168 1 week ago

No Oficial - 26 t/s con 8 VRAM MOE A3B + MPT

vision tools
ollama run aratan/qwen3.7-abliterated-35b-q4

Applications

Claude Code
Claude Code ollama launch claude --model aratan/qwen3.7-abliterated-35b-q4
OpenCode
OpenCode ollama launch opencode --model aratan/qwen3.7-abliterated-35b-q4
Hermes Agent
Hermes Agent ollama launch hermes --model aratan/qwen3.7-abliterated-35b-q4
OpenClaw
OpenClaw ollama launch openclaw --model aratan/qwen3.7-abliterated-35b-q4

Models

View all →

Readme

SIN CENSURA + think Aunque no lo marque arriba

Calidad a escala fronteriza como GPT-5.5, DeepSeek-V4-pro y Kimi-K2.6. en LOCAL

Equivale a un modelo de un TRILLON de parametros.

image.png

Lo más destacado

Razonamiento Agénico: Los agentes-A1 sobresalen en la descomposición de tareas complejas en subpasos ejecutables, la planificación anticipada y la adaptación de su estrategia basada en resultados intermedios. Uso de la herramienta: admite de forma nativa la llamada de funciones y la integración de herramientas, lo que permite una interacción perfecta con las API, los intérpretes de código, los motores de búsqueda y otras herramientas externas.

Razonamiento científico y profesional: Maneja el razonamiento científico integrado en la herramienta y la respuesta a preguntas sobre el conocimiento profesional. Instrucciones Siguiente: Sigue con precisión las instrucciones detalladas y multi-restricción en diversos dominios.

Damos la bienvenida a los desarrolladores y empresas para integrar y probar Agents-A1 y compartir sus comentarios. Rendimiento

Evaluamos Agents-A1 en flujos de trabajo agenticales y orientados a la investigación en el mundo real en seis direcciones: búsqueda de horizonte largo, tareas de ingeniería, investigación científica, seguimiento de instrucciones, tareas de agente general y tareas de agente científico.

Agents-A1: Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

A pesar de operar en la clase de modelo ~ 35B A3B , Agents-A1 ofrece un rendimiento altamente competitivo frente a sistemas a escala fronteriza como GPT-5.5, DeepSeek-V4-pro y Kimi-K2.6. Logra resultados generales de SOTA en varios puntos de referencia desafiantes, incluidos Seal-0 (56.4), HiPhO (46.4), FrontierScience-Olympiad (79.0), FrontierScience-Research (40.00), IFBench (80.6) e IFEval (94.8), mientras que también se clasifica como el mejor entre los modelos comparables en una amplia gama de tareas como BrowseComp (75.5), XBench-DS Estos resultados muestran que Agents-A1 combina una fuerte capacidad de búsqueda de horizonte largo, un razonamiento científico robusto y un seguimiento de instrucciones confiables, estableciéndolo como un modelo agente altamente capaz y eficiente que reduce la brecha con modelos fronterizos mucho más grandes.

Equivalencia

GPT-4o / Claude 3.5 / Gemini 1.5 pro - 2.0

Abliterated by Huihui

FineTuning by InternScience

InternScience Agents-A1 ha destacado rápidamente en la comunidad de código abierto (open weights). Su premisa principal es el “Horizon Scaling” (escalar la duración del razonamiento y la trayectoria en lugar de añadir billones de parámetros).


1. Lo Más Destacado

  • Arquitectura eficiente (MoE 35B/3B): Aunque cuenta con 35 mil millones de parámetros totales en una arquitectura de Mixture of Experts (MoE), solo tiene ~3 mil millones de parámetros activos por token, lo que permite una ejecución rápida y ligera en hardware local o de servidor modesto (ej. consumiendo unos 26 GB de VRAM en versiones cuantizadas Q8 o corriendo fluido en Macs de 32GB).
  • Entrenamiento en trayectorias ultra-largas: Fue entrenado en trazas agénticas complejas con un promedio de 45.000 tokens por sesión de trabajo real (con observaciones, llamadas a herramientas y verificación de errores integrados).
  • Pipeline de Destilación en 3 Etapas: No pasó de un fino ajuste básico a la respuesta final; la organización entrenó modelos profesores especializados por dominio (Búsqueda, Código, Herramientas, Ciencia) y luego los destiló todos mediante On-Policy Distillation en un único modelo de 35B.
  • Licencia Permisiva: Distribuido bajo licencia Apache 2.0, apto para uso comercial y despliegue privado/local sin depender de APIs de terceros.
  • Ventana de contexto: Soporta nativamente 262K tokens de contexto.
  • Multimodal: Soporta imagen a texto. —

2. ¿En qué es MUY BUENO?

  1. Búsqueda e Investigación de Horizonte Largo (Long-horizon Search): Es líder (State-of-the-Art) en benchmarks de investigación web compleja donde debe encadenar decenas de búsquedas y validar evidencia.
  2. Seguimiento Estricto de Instrucciones (Instruction Following): Almacena y respeta múltiples restricciones complejas en una sola instrucción (por ejemplo, limitaciones de longitud, tono, exclusión de palabras o reglas de formato simultáneas).
  3. Uso de Herramientas y Razonamiento Científico: Ejecuta de forma robusta function calling, APIs, intérpretes de código y herramientas avanzadas en flujos agénticos (como agentes de automatización estilo Hermes o editores de código estilo Zed).
  4. Relación Rendimiento / Recurso Local: Entrega un nivel de capacidad agéntica que antes requería infraestructura masiva en la nube, ejecutable ahora en una única GPU de 48GB/80GB o mediante cuantización en estaciones de trabajo locales con una GPU de 8 VRAM y 32 GB RAM. a 27 t/s

3. ¿En qué NO es tan bueno (Limitaciones)?

  1. Modelado Puro de Texto / Conversación General: No fue concebido para ser un chat conversacional cotidiano ni para empatía creativa. Si no se le asigna un entorno agéntico o tareas orientadas a objetivos estructurados, puede ser redundante o “pensar demasiado” (thinking spiral).
  2. Velocidad e Inferencia (“Pensamiento Profundo”): Al hacer ciclos internos de verificación, planificación y uso recursivo de herramientas, la latencia para entregar el resultado final en tareas complejas puede ser alta comparada con modelos orientados a respuesta rápida.
  3. ** Codificación Pura de Gran Escala:** Aunque edita y genera archivos HTML/JS/Python correctamente, en benchmarks de programación pura y arquitectura de código masivo desde cero sigue por detrás de los mejores modelos cerrados de frontera.

4. Comparativa con otros modelos: ¿A cuáles supera?

El aspecto más llamativo de Agents-A1 es su capacidad para superar a modelos de clase Frontier y escala de 1 Trillón (o cientos de miles de millones) de parámetros en tareas agénticas y de búsqueda profunda, a pesar de su tamaño reducido:

Benchmark: Búsqueda de Horizonte Largo (SEAL-0)

  • Agents-A1 (35B/3B): 56.4 (SOTA Global)
  • DeepSeek-V4 Pro (Max): 55.0
  • Kimi K2.6: 50.5
  • GPT-5.5 (xhigh): 42.3
  • Qwen 3.6-35B-A3B (Base): 38.7

Benchmark: Investigación Científica Avanzada con Herramientas (FrontierScience-Research)

  • Agents-A1: 40.0
  • GPT-5.5 (xhigh): 26.7
  • Kimi K2.6: 17.9
  • DeepSeek-V4 Pro: 13.3

Benchmark: Seguimiento de Instrucciones Múltiples (IFBench / IFEval)

  • Agents-A1: 80.6 / 94.8
  • GPT-5.5: 75.9 / 93.3
  • DeepSeek-V4 Pro: 73.5 / 93.3
  • Kimi K2.6: 71.8 / 94.5

Benchmark: Agente General (GAIA)

  • DeepSeek-V4 Pro: 98.1 (Supera a Agents-A1)
  • Agents-A1: 96.0
  • GPT-5.5: 87.4
  • Kimi K2.6: 80.6

  1. Para programacion pura agentica y manipulacion de repositorio es mejor Laguna XS Laguna XS ha sido preentrenado y ajustado por Poolside desde la base de datos con un único propósito: escribir, refactorizar, ejecutar comandos en terminal y resolver bugs en bases de código completas.

  2. Para investigación técnica, integración de herramientas externas y análisis científico, es mejor Agents-A1. Agents-A1 es un modelo de investigación/agente generalista que sabe programar bien (especialmente scripts, automatización web o componentes HTML/JS), pero su fuerte es la investigación, el razonamiento profundo y el seguimiento estricto de restricciones, no la arquitectura de software pura.

Resumen

Agents-A1 demuestra que para tareas agénticas (autonomía, llamadas a herramientas, investigación de múltiples pasos e ingeniería estructurada), el diseño de la trayectoria de entrenamiento y la arquitectura de destilación por dominios importa más que la masa bruta de parámetros, permitiendo que un modelo local de 35B supere a gigantes de la industria en flujos de trabajo de investigación autónoma.