Inteligencia Artificial
Los LFM2.5-Encoders abogan por los modelos pequeños: 3,7× más rápidos que ModernBERT en CPU
Los LFM2.5-Encoders de pesos abiertos de Liquid AI defienden que el NLP de producción pertenece a los modelos pequeños. Un encoder de 230M supera a ModernBERT-base en los benchmarks y escanea documentos completos en unos 28 segundos en una CPU de portátil, aproximadamente 3,7× más rápido.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-05 · 5 min de lectura

Desde hace tiempo, el movimiento por defecto en NLP ha sido apuntar un modelo generativo al problema y pagar por el privilegio. El nuevo lanzamiento de Liquid AI plantea un argumento más silencioso: las tareas que funcionan las 24 horas, el enrutamiento de intenciones, las verificaciones de políticas, el escaneo de PII y la clasificación de texto se manejan mejor con un pequeño encoder instalado en una CPU de portátil.
Los LFM2.5-Encoders tienen pesos abiertos y están hoy en Hugging Face, construidos a partir de los backbones decodificadores LFM2.5 de Liquid AI. La empresa convierte cada decodificador causal en un encoder bidireccional y sitúa el resultado frente a la clase de modelos que ha ocupado este terreno desde BERT. El planteamiento es simple: no necesitas un modelo de miles de millones de parámetros para decidir si un ticket de soporte menciona un reembolso o si un contrato contiene una cláusula prohibida.
Una ventaja de velocidad de 3,7× en el extremo superior de la ventana de contexto
Tanto los LFM2.5-Encoders como ModernBERT soportan un contexto de 8.192 tokens, por lo que la comparación cubre todo el rango. En CPU, es donde se nota la diferencia. ModernBERT-base tarda más de un minuto y medio por pasada hacia adelante en la longitud máxima. El LFM2.5-Encoder-230M hace la misma pasada en unos 28 segundos. Liquid AI lo califica de aproximadamente 3,7× más rápido, y afirma que el 230M es el modelo más rápido de la comparación en todas las longitudes de secuencia, incluso por delante del ModernBERT-base, que es más pequeño, en entradas cortas.
El rendimiento (throughput) cuenta la misma historia a la inversa. A medida que las entradas se alargan, el throughput de ModernBERT cae bruscamente, mientras que las curvas de LFM2.5 ascienden hasta un punto medio antes de disminuir. La consecuencia práctica, según la empresa: un contrato completo, una transcripción o un hilo de soporte largo pueden escanearse o clasificarse en menos de 30 segundos en una CPU de portátil. Esa es la diferencia entre una tarea que se ejecuta de forma selectiva y una que puedes permitirte ejecutar en todos los casos.
La tabla de benchmarks: 14 modelos, 17 tareas
Liquid AI ajustó 14 modelos en 17 tareas extraídas de GLUE, SuperGLUE y clasificación multilingüe, reportando la media en cinco semillas reservadas para cada uno. El LFM2.5-Encoder-350M ocupa el cuarto puesto de los 14. Los tres modelos que le preceden son todos más grandes, incluido uno de 3,5B parámetros, casi diez veces su tamaño. El modelo de 230M supera a ModernBERT-base y a todos los modelos EuroBERT de la tabla, a pesar de ser más pequeño que la mayoría de ellos. Ambos también puntúan por encima de los propios LFM2.5-Retrievers de Liquid AI del mes pasado.
| Modelo | Posición en los benchmarks | Pasada hacia adelante en CPU con 8.192 tokens |
|---|---|---|
| LFM2.5-Encoder-230M | Supera a ModernBERT-base y a todos los modelos EuroBERT | Unos 28 segundos |
| LFM2.5-Encoder-350M | 4.º de 14, detrás de tres modelos más grandes | Rango medio, disminuye hacia el extremo superior |
| ModernBERT-base | Por debajo del 230M en la misma tabla | Más de un minuto y medio |
Estas son cifras propias de la empresa, y el marco de trabajo y los resultados brutos son de código abierto, por lo que la tabla se puede comprobar en lugar de tomarse a ciegas.
Por qué un encoder de 230M supera a un LLM generativo en tareas de ejecución continua
La economía es el punto clave. Un encoder ajustado es más pequeño, más rápido y mucho más barato de ejecutar que un LLM generativo, y cabe en las CPU que una empresa ya posee, según Liquid AI. La arquitectura se lleva el mérito de la eficiencia. Cada encoder se inicializa desde uno de los backbones decodificadores LFM2 y luego se vuelve bidireccional con tres cambios: una máscara de atención bidireccional, convoluciones cortas no causales con padding simétrico y un objetivo de lenguaje enmascarado que oculta el 30% de los tokens durante el entrenamiento.
El entrenamiento se desarrolla en dos etapas. La primera construye competencia general del lenguaje sobre un gran corpus web con un contexto de 1.024 tokens. La segunda extiende el contexto a 8.192 tokens con la mezcla de datos completa, lo que, según la empresa, refuerza la competencia factual, jurídica y multilingüe. El nicho es explícito: tareas de comprensión de alto volumen, clasificación, enrutamiento, extracción y puntuación que se ejecutan constantemente y deben seguir siendo baratas.
En GPU, el patrón se mantiene con un margen menor. ModernBERT-base lidera por debajo de aproximadamente 1.000 tokens en la GPU de Apple, y los modelos LFM2.5 toman la delantera a partir de unos 2.000 tokens. Las cifras de CPU son donde aterriza el argumento: estas tareas se ejecutan todo el día, normalmente en CPU.
Qué puedes construir y cuánto cuesta empezar
Liquid AI publicó cinco demos, cada una en un espacio de Hugging Face solo con CPU. El enrutamiento de prompts zero-shot puntúa un prompt completo frente a rutas de enrutamiento escritas como texto libre en una sola pasada. El linting de políticas comprueba el texto frente a las reglas de la empresa, también en texto libre, puntuando cada token frente a cada regla. La revisión ortográfica corrige faltas de ortografía token por token. La detección de PII elimina 40 tipos de información personal en 16 idiomas. Una demo adicional convierte el encoder en un chatbot de difusión enmascarada, que genera texto mediante desenmascarado iterativo en lugar de izquierda a derecha.
El coste de entrada son unas pocas líneas de código de transformers. Carga el modelo con AutoModelForMaskedLM para la predicción de tokens enmascarados, o carga el cuerpo con AutoModel y añade tu propia cabeza para clasificación, clasificación de tokens, regresión o recuperación. El ajuste fino es por tarea: la empresa señala el 350M cuando la precisión importa más y el 230M para hardware más limitado o mayor throughput, con un tutorial que cubre documentos legales largos con contexto de 8K.
Los encoders nunca desaparecieron realmente, solo pasaron de moda frente a los modelos generativos. Lo que Liquid AI añadió es lo que en primer lugar empujó a los equipos hacia los modelos generativos: contexto largo e inferencia rápida. El resultado es una clase de modelos que compite en las métricas que la gente realmente nota, la latencia y el coste por documento, publicando ambos tamaños como pesos abiertos en Hugging Face.
- Fuente : LFM2.5-Encoders make the small-model case: 3.7× faster than ModernBERT on CPU — 2026-07-28
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.