16 5 days ago

33 t/s muy rapido en 8-VRAM ( Codificacion Agentica )

tools thinking
ollama run aratan/laguna-xs-2.1:q4_K_M

Applications

Claude Code
Claude Code ollama launch claude --model aratan/laguna-xs-2.1:q4_K_M
OpenCode
OpenCode ollama launch opencode --model aratan/laguna-xs-2.1:q4_K_M
Hermes Agent
Hermes Agent ollama launch hermes --model aratan/laguna-xs-2.1:q4_K_M
OpenClaw
OpenClaw ollama launch openclaw --model aratan/laguna-xs-2.1:q4_K_M

Models

View all →

Readme

Este modelo de pesos abiertos viene de una empresa que trabajaba para gobiernos y defensa, especializada en agentes de codificacion, automatizacion, trabajo con repositorios “trabajo de programador”

Ventana de Contexto

El modelo Laguna XS 2.1 (desarrollado por Poolside) cuenta con una ventana de contexto de 256.000 tokens (262.144 tokens exactos) y admite una generación máxima de salida de hasta 32.768 tokens (32K).


Especificaciones Técnicas Clave

  • Arquitectura: Mixture-of-Experts (MoE).
  • Parámetros: 33B totales, con solo 3B activos por token.
  • Especialización: Agentes de programación (agentic coding), uso de herramientas (tool calling), ejecución de comandos en terminal y refactorización de código en proyectos complejos.

Comparación con Modelos Locales y Valoración de la Comunidad

1. Eficiencia y Requisitos de Hardware

  • Velocidad de respuesta: Al activar solo 3B de parámetros por token, ofrece velocidades de generación (tokens/s) similares a las de un modelo pequeño de 3B-7B, pero conservando la capacidad de razonamiento de un modelo de 33B.
  • Despliegue local: Está disponible en formatos GGUF, FP8 y NVFP4, lo que permite ejecutarlo fácilmente mediante Ollama, vLLM, LM Studio o integradores de código como Kilo Code y Cline.

2. Rendimiento en Programación vs. Alternativas Locales

  • SWE-bench Verified: Alcanza un 70.9%, posicionándose de forma muy competitiva frente a modelos densos de referencia como Qwen2.5-Coder 32B o Llama 3.1.
  • Terminal-Bench 2.0: Obtiene un 37.5% en ejecuciones de terminal y tareas agénticas autónomas.

3. Impresiones de los Creadores de Contenido y Probadores

  • Excelente comportamiento con herramientas: Destacan su consistencia para interpretar la estructura de repositorios y realizar llamadas a herramientas (tool calling) sin romper sintaxis.
  • Modo de pensamiento (Thinking mode): Permite razonar de forma explícita antes de editar archivos o ejecutar comandos de terminal.
  • Ideal para flujos 100% offline: Quienes lo han probado resaltan que es una de las opciones locales más equilibradas para agentes de código privados, ya que no requiere enviar fragmentos de código sensibles a la nube manteniendo un bajo consumo de VRAM.

Probaron el modelo integrado con herramientas como Hermes Agent para detectar y corregir errores dispersos en el front-end y back-end (SQL) de una aplicación rota.

    Resultado: Logró diagnosticar de manera autónoma el repositorio, identificar los fallos y corregir la base de datos sin romper dependencias.

Traducción Multilingüe de Código Complejo (Go, Rust, C++):

    Se evaluó la capacidad del modelo para traducir código en Go (aprovechando concurrencia, semántica de slices y gestión de memoria) hacia 8 lenguajes distintos (C, C++, Rust, Java, TypeScript, Ruby, PHP).

    Resultado: Pasó la prueba con éxito. Manejó correctamente la asignación manual de memoria (malloc) en C, el uso de genéricos en C++ y las semánticas de préstamo (borrow checker / vec with capacity) en Rust, demostrando comprensión del significado semántico y no solo sintáctico.

Desarrollo Web Ligero e Interfaces (Landing Pages / Apps simples):

    Para generar páginas web simples, aplicaciones estilo To-Do interactivas y componentes limpios, muestra un desempeño muy sólido de forma local.
  1. Puntos Débiles y Limitaciones Observadas

    Físicas y Renderizado de Alto Nivel (Simulaciones complejas):

    Al solicitarle la creación de simulaciones avanzadas con físicas en un único archivo HTML (como ondas de agua en 2D/3D o interacciones complejas de partículas), el modelo suele fallar en la lógica de físicas y matemáticas avanzadas.
    

    Terminal-Bench / Comandos de Terminal:

    Aunque es un modelo pensado para agentes, en tareas estrictas de terminal (Terminal-Bench) rinde por debajo de modelos comerciales más grandes o especializados, por lo que puede requerir instrucciones más guiadas en la consola.
    
  2. Vías de Integración Táctica para Ejecución Local

    Local Directo (GGUF / Ollama / vLLM):

    Gracias a sus solo 3B de parámetros activos por token y al uso de FP8 en el KV Cache, se puede ejecutar de forma muy rápida y fluida en equipos locales con recursos moderados (soporta cuantizaciones NV4 / GGUF).
    

    Uso Vía API Gratuita (OpenRouter):

    Varios creadores señalan que se puede acceder al API de Laguna XS 2.1 de forma totalmente gratuita a través de OpenRouter, lo que permite integrarlo sin costo en la terminal con Hermes Agent o en el editor VS Code / OpenCode / Cline en caso de querer liberar carga de la VRAM/RAM local.
    

Model overview XS

Training: pre-training, post-training and reinforcement learning stages
Number of parameters: 33B total with 3B activated per token
Optimizer: Muon
Layers: 40 layers (10 layers with global attention, 30 layers with sliding window attention)
Experts: 256 experts with 1 shared expert
Sliding Window: 512 tokens
Modality: text-to-text
Context window: 262,144 tokens
Reasoning support: interleaved thinking with preserved thinking

imagen.png

La version S del modelo esta en la 6 posicion de los mejores de pesos abiertos.

imagen.png