5 2 hours ago

Pensado para gente que quiere un asistente local, privado, que responda lo que se le pregunta sin darle vueltas moralistas innecesarias.

ollama run virtuanista/lfm2.5-8b-a1b-uncensored:iq4_xs

Details

2 hours ago

a6985bdc0658 · 4.6GB ·

lfm2moe
·
8.47B
·
IQ4_XS
{{ if .System }}<|startoftext|><|im_start|>system {{ .System }}<|im_end|> {{ end }}{{ if .Prompt }}<
LFM Open License v1.0 - Ver archivo LICENSE completo en el repositorio. Base model: Liquid AI, Inc.
{ "stop": [ "<|startoftext|>", "<|im_start|>", "<|im_end|>", "<|

Readme

Qué es esto

Una versión sin censura del LFM2.5-8B-A1B de Liquid AI, empaquetada en GGUF y lista para ejecutar en cualquier equipo o servidor con llama.cpp u Ollama. El modelo base tiene una arquitectura híbrida poco habitual (convolución + atención + MoE) que responde rápido, razona con bloques <think>...</think> y mantiene 128K tokens de contexto — todo eso se conserva intacto, solo se le ha quitado el reflejo de rechazo entrenado por defecto.

Pensado para quien quiera un asistente local y privado, que responda a lo que se le pregunta sin rodeos moralistas innecesarios.

Por qué esta versión y no otra

  • Arquitectura correctamente identificada. LFM2.5 no es un Transformer puro — combina bloques de convolución corta (shortconv/LIV) con atención GQA y capas MoE. Las herramientas genéricas de abliteration apuntan a matrices que en esta arquitectura ni siquiera existen. Aquí se identificaron los tensores reales que llevan la señal de rechazo (conv.out_proj, self_attn.out_proj, feed_forward.w2, con foco en las capas 11-23 y pico en la capa 16) y se modificaron con precisión quirúrgica.
  • Capacidades intactas. El razonamiento, el seguimiento de instrucciones y la calidad general se verificaron tras la modificación — la idea no es romper el modelo, sino quitarle el freno de mano.
  • Cinco cuantizaciones, para elegir según el hardware disponible.

Especificaciones técnicas

Arquitectura lfm2moe (híbrida: shortconv + GQA + MoE)
Parámetros totales 8.3B
Parámetros activos por token ~1.5B (4 de 32 expertos)
Bloques 24
Contexto 128K tokens
Calibración iMatrix en todas las cuantizaciones

Cuantizaciones disponibles

Archivo Tamaño Recomendado para
LFM2.5-8B-A1B-Uncensored-IQ4_XS.gguf 4.6 GB Hardware muy limitado
LFM2.5-8B-A1B-Uncensored-Q4_K_M.gguf 5.2 GB Uso general — mejor equilibrio
LFM2.5-8B-A1B-Uncensored-Q5_K_M.gguf 6.0 GB Más calidad, poco coste extra
LFM2.5-8B-A1B-Uncensored-Q6_K.gguf 7.0 GB Casi sin pérdida perceptible
LFM2.5-8B-A1B-Uncensored-Q8_0.gguf 9.0 GB Máxima fidelidad al modelo original

Cómo ejecutarlo

Ollama (la forma más sencilla):

ollama run virtuanista/lfm2.5-8b-a1b-uncensored          # Q4_K_M por defecto
ollama run virtuanista/lfm2.5-8b-a1b-uncensored:q8_0     # otra cuantización

llama.cpp:

llama-cli -m LFM2.5-8B-A1B-Uncensored-Q4_K_M.gguf -ngl 99 -c 16384

llama-server (API compatible con OpenAI):

llama-server -m LFM2.5-8B-A1B-Uncensored-Q4_K_M.gguf -ngl 99 -c 16384

Atribución

  • Modelo base: Liquid AILFM2.5-8B-A1B, lanzado el 28 de mayo de 2026.
  • Abliteration, cuantización y mantenimiento de esta versión: virtuanista.

Distribuido bajo los mismos términos de la LFM Open License v1.0 (ver LICENSE), que conserva los avisos de atribución del modelo original de Liquid AI.

Uso responsable

Este modelo no tiene las barreras de seguridad por defecto del modelo base. Eso significa que responde con menos filtros, no que sea infalible ni que deba usarse para generar contenido dañino, ilegal, o para engañar a terceros. La responsabilidad sobre el uso que se le dé al resultado es de quien lo utiliza.

Licencia

LFM Open License v1.0 — ver LICENSE. Uso comercial permitido por debajo de 10 millones de USD de ingresos anuales; sin límite para investigación o uso no lucrativo. Cualquier redistribución debe conservar los avisos de copyright y atribución de Liquid AI.