SevenTnewS

Agents IA embarqués

LFM2.5-2.6B : le petit agent qui distance des modèles 4 fois plus gros

Le LFM2.5-2.6B de Liquid AI fait tenir un modèle agentique dans 2,6 milliards de paramètres et moins de 2,5 Go de mémoire, et domine tous les benchmarks de suivi d'instructions sur lesquels il a été testé. Il tourne à 220 tokens/s sur un ordinateur portable ; le code est la seule lacune claire.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-12 · 4 min de lecture

LFM2.5-2.6B : le petit agent qui distance des modèles 4 fois plus gros

La course à la création d'agents IA utiles a surtout été un jeu d'échelle : des modèles plus gros, des contextes plus longs, davantage d'outils dans la boucle. Liquid AI parie sur l'inverse. Son nouveau LFM2.5-2.6B condense la pile agentique en 2,6 milliards de paramètres qui tiennent dans moins de 2,5 Go de mémoire. Selon ses propres évaluations, le modèle rivalise avec des concurrents jusqu'à quatre fois plus gros sur l'utilisation d'outils et les tâches agentiques multi-étapes, et les dépasse tous sur le suivi d'instructions.

C'est l'argument de vente, et pour une fois il y a des chiffres derrière. Liquid AI a publié une série complète de benchmarks contre quatre modèles plus grands : gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) et Qwen3.5-9B (9.7B). LFM2.5-2.6B est le plus petit modèle du groupe.

Le plus petit modèle du groupe, en tête sur le suivi d'instructions

Liquid indique que son modèle de 2,6B est premier sur chaque benchmark de suivi d'instructions de la suite, et premier sur chaque benchmark d'utilisation d'outils sauf BFCLv4, où seul le Qwen de 9.7B prend l'avantage.

BenchmarkLFM2.5-2.6B (2.6B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)Qwen3.5-4B (4.7B)Qwen3.5-9B (9.7B)
AA Omniscience-29.50-74.47-49.03-54.30-50.43
AIME2551.8726.3334.2749.3356.07
IFBench59.1734.0839.2448.4056.47
Multi-IF80.0769.4477.3555.6762.55
BFCLv456.8836.9846.3950.5660.13
ToolSandbox77.8352.4065.0075.5576.44
BrowseComp+ (OpenClaw)26.898.3115.9024.4627.23

Sur les tâches agentiques, le tableau est plus équilibré : LFM2.5-2.6B bat les deux modèles Gemma et reste au niveau des Qwen, et il obtient le meilleur score AA Omniscience du groupe. Liquid résume les résultats comme une avance sur les connaissances et une proximité en mathématiques. Ce sont les chiffres de l'entreprise, sans vérification par un tiers, mais les écarts, là où ils existent, ne sont pas minces.

Quatre étapes d'entraînement, une astuce de harnais en boîte noire

LFM2.5-2.6B part d'un modèle de base pré-entraîné sur environ 34 000 milliards de jetons, avec une phase d'entraînement intermédiaire qui étend la fenêtre de contexte à 128K. Le comportement agentique vient du post-entraînement, qui se déroule en quatre étapes.

  • Deux passages de fine-tuning supervisé, orientés vers les données agentiques : utilisation d'outils, recherche web et trajectoires de harnais.
  • Un enseignant spécialiste par domaine : mathématiques, code, utilisation d'outils, etc.
  • Distillation multi-domaines on-policy, qui réunit les enseignants en un unique élève.
  • Apprentissage par renforcement agentique, où la RL multi-tours s'exécute dans de vrais harnais d'agents pour que le modèle apprenne à travers les outils, les prompts système et les environnements de tâches multi-tours.

L'ingénierie qui mérite l'attention se trouve dans cette dernière étape. Liquid sépare l'optimisation du modèle, l'inférence et l'exécution de l'environnement, puis fait tourner l'agent dans un harnais en boîte noire, citant OpenClaw et Hermes Agent comme exemples. Un Harness Proxy intercepte les appels de modèle du harnais et enregistre les trajectoires au niveau des jetons dont la boucle d'entraînement a besoin, sans modifier le harnais. C'est la même conception que OpenForgeRL, un framework open source que notre couverture suit : un proxy léger transforme les appels du harnais en données d'entraînement pour une base de code RL standard, et chaque rollout s'exécute dans son propre conteneur Kubernetes.

Le compromis, c'est que le harnais lui-même devient une partie de la surface d'entraînement. Le travail OpenForgeRL documente que certains harnais sont nettement plus difficiles à apprendre que d'autres, et que la RL améliore surtout la fiabilité tandis que des capacités critiques comme la récupération d'erreurs restent faibles.

Assez rapide pour un téléphone, assez économique pour une flotte

Il y a aussi la vitesse brute. Liquid annonce un décodage à 220 tokens/s sur un Apple M5 Max et 113 tokens/s sur un AMD Ryzen AI Max+ 395, le tout sous 2,5 Go de mémoire. À 30 tokens/s, le modèle est, selon l'entreprise, assez rapide pour un agent capable sur téléphone. Avec une forte simultanéité sur un seul H100, il atteint près de 15 000 jetons de sortie par seconde, soit environ 1,3 milliard de jetons par jour.

La prise en charge dès le premier jour couvre llama.cpp, MLX, vLLM, SGLang et ONNX, et le modèle se charge via transformers 5.0.0 ou ultérieur. LFM2.5-2.6B et la variante LFM2.5-2.6B-Base sont sur Hugging Face, une démo WebGPU fait tourner un agent de recherche dans le navigateur, et Liquid a publié des guides pour exécuter des agents locaux dans des harnais comme OpenClaw, Hermes Agent et Pi.

Le code est l'endroit où les modèles plus gros justifient leur taille

Le seul endroit où l'avantage de taille s'inverse, c'est le code. Sur LiveCodeBench v6, chaque rival sauf le Gemma de 5.1B obtient un score supérieur au 59.41 de LFM2.5-2.6B. Liquid reconnaît que les modèles plus gros gardent une avance nette dans ce domaine et recommande d'opter pour quelque chose de plus gros. C'est une concession qu'il vaut la peine de lire de près, car d'autres laboratoires font du code la pièce maîtresse de l'entraînement agentique. MiniMax M3, que notre couverture a vu dépasser GPT-5.5 sur du code réel, a été entraîné sur des séquences d'interaction multi-tours via un simulateur d'utilisateur interactif. Liquid a choisi l'inverse : petit, général, rapide et explicitement pas pour le code.

Les deux sont des paris sur la même thèse : le comportement agentique vient de la façon dont un modèle est entraîné, pas seulement de sa taille. Liquid qualifie cette sortie de pas vers « une IA qui fonctionne partout ». Pour l'utilisation d'outils, le suivi d'instructions et les tâches multi-étapes sur matériel local, les chiffres rendent cet argument crédible. Pour tout le reste, il y a toujours un modèle plus gros.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.