Agentes de IA on-device
LFM2.5-2.6B: el diminuto agente que deja atrás a modelos cuatro veces más grandes
El LFM2.5-2.6B de Liquid AI comprime un modelo agéntico en 2.6B parámetros y menos de 2,5 GB de memoria, liderando todos los benchmarks de seguimiento de instrucciones en los que fue probado. Corre a 220 tokens/s en un portátil; el código es la única brecha clara.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-12 · 4 min de lectura

La carrera por construir agentes de IA útiles ha sido en su mayoría un juego de escala: modelos más grandes, contextos más largos, más herramientas en el bucle. Liquid AI apuesta en la dirección opuesta. Su nuevo LFM2.5-2.6B comprime el stack agéntico en 2.600 millones de parámetros que se ejecutan en menos de 2,5 GB de memoria. En las evaluaciones propias de la compañía, el modelo compite con rivales de hasta cuatro veces su tamaño en uso de herramientas y tareas agénticas de múltiples pasos, y los supera a todos en seguimiento de instrucciones.
Ese es el argumento de venta y, por una vez, hay números que lo respaldan. Liquid AI publicó una ejecución completa de benchmarks contra cuatro modelos más grandes: gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) y Qwen3.5-9B (9.7B). LFM2.5-2.6B es el modelo más pequeño de ese grupo.
El modelo más pequeño del grupo, por delante en seguimiento de instrucciones
Liquid sitúa su modelo de 2.6B en primer lugar en todos los benchmarks de seguimiento de instrucciones de la suite, y en primer lugar en todos los benchmarks de uso de herramientas excepto BFCLv4, donde solo el Qwen de 9.7B se adelanta por poco.
| Benchmark | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
En tareas agénticas el panorama es más equilibrado: LFM2.5-2.6B supera a ambos modelos Gemma y se mantiene a la par con los Qwen, y registra la mejor puntuación AA Omniscience del grupo. Liquid resume los resultados como liderazgo en conocimiento y cercanía en matemáticas. Son cifras propias de la compañía, sin verificación de terceros, pero los márgenes, donde existen, no son pequeños.
Cuatro etapas de entrenamiento, un truco de harness de caja negra
LFM2.5-2.6B parte de un modelo base preentrenado con aproximadamente 34 billones de tokens, con una fase de entrenamiento intermedio que amplía la ventana de contexto a 128K. El comportamiento agéntico proviene del post-entrenamiento, que se ejecuta en cuatro etapas.
- Dos rondas de fine-tuning supervisado, centradas en datos agénticos: uso de herramientas, búsqueda web y trayectorias de harness.
- Un profesor especialista por dominio: matemáticas, código, uso de herramientas y más.
- Destilación on-policy multi-dominio, que reincorpora a los profesores en un único estudiante.
- Aprendizaje por refuerzo agéntico, donde el RL multi-turno se ejecuta dentro de harnesses de agentes reales para que el modelo aprenda a través de herramientas, prompts de sistema y entornos de tareas multi-turno.
La ingeniería que vale la pena destacar está en esa última etapa. Liquid separa la optimización del modelo, la inferencia y la ejecución del entorno, y luego ejecuta el agente dentro de un harness de caja negra, citando OpenClaw y Hermes Agent como ejemplos. Un Harness Proxy intercepta las llamadas al modelo del harness y registra las trayectorias a nivel de token que el bucle de entrenamiento necesita, sin modificar el harness. Es el mismo diseño detrás de OpenForgeRL, un framework de código abierto que nuestra cobertura ha estado siguiendo: un proxy ligero convierte las llamadas del harness en datos de entrenamiento para un codebase de RL estándar, y cada rollout se ejecuta en su propio contenedor de Kubernetes.
La contrapartida es que el propio harness se convierte en parte de la superficie de entrenamiento. El trabajo de OpenForgeRL documenta que algunos harnesses son sustancialmente más difíciles de aprender que otros, y que el RL mejora sobre todo la fiabilidad, mientras que capacidades críticas como la recuperación de errores siguen siendo débiles.
Suficientemente rápido para un teléfono, suficientemente barato para una flota
Luego está la velocidad bruta. Liquid reporta un decode de 220 tokens/s en un Apple M5 Max y 113 tokens/s en un AMD Ryzen AI Max+ 395, ambos con menos de 2,5 GB de memoria. A 30 tokens/s, dice la compañía, el modelo es lo bastante rápido para un agente capaz en un teléfono. Con alta concurrencia en una sola H100, logra casi 15.000 tokens de salida por segundo, aproximadamente 1.300 millones de tokens al día.
El soporte desde el primer día cubre llama.cpp, MLX, vLLM, SGLang y ONNX, y el modelo se carga a través de transformers 5.0.0 o posterior. Tanto LFM2.5-2.6B como la variante LFM2.5-2.6B-Base están en Hugging Face, una demo WebGPU ejecuta un agente de investigación en el navegador, y Liquid publicó guías para ejecutar agentes locales en harnesses como OpenClaw, Hermes Agent y Pi.
El código es donde los modelos más grandes justifican su tamaño
El único lugar donde la ventaja de tamaño se invierte es el código. En LiveCodeBench v6, todos los rivales excepto el Gemma de 5.1B puntúan más alto que el 59,41 de LFM2.5-2.6B. Liquid dice que los modelos más grandes mantienen allí una ventaja clara y recomienda recurrir a algo más grande. Es una concesión que vale la pena leer con atención, porque otros laboratorios están convirtiendo el código en la pieza central del entrenamiento agéntico. MiniMax M3, al que nuestra cobertura encontró superando a GPT-5.5 en código real, se entrenó con secuencias de interacción multi-turno a través de un simulador de usuario interactivo. Liquid fue en la dirección opuesta: pequeño, general, rápido y explícitamente no para código.
Ambas son apuestas sobre la misma tesis: el comportamiento agéntico proviene de cómo se entrena un modelo, no solo de lo grande que es. Liquid califica el lanzamiento como un paso hacia 'IA que se ejecuta en cualquier lugar'. Para el uso de herramientas, el seguimiento de instrucciones y las tareas de múltiples pasos en hardware local, los números hacen creíble esa propuesta. Para todo lo demás, siempre hay un modelo más grande.
- Fuente : LFM2.5-2.6B: the tiny agent that outruns models 4x its size — 2026-08-04
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.