SevenTnewS

Entraînement des LLM

5 published articles

LLM & Modèles3 min read

IA open source

Boris-2 nourrit son modèle 125M avec 90B tokens, et son 250M avec seulement 60B

Boris-2 pré-annonce trois petits modèles avec des budgets de tokens déséquilibrés : le 125M reçoit 90B tokens, le 250M seulement 60B. L'entraînement se déroule du 12 août au 10 septembre, sans benchmark partagé, seulement l'ambition déclarée d'atteindre la puissance de SmolLM2-135M.

2026-08-16

Open Source6 min read

Open Source

Une course de relais de GPU loués a entraîné le MoE 2,7B de NanoColibri pour 200 $

NanoColibri-Instruct est passé de poids vierges à un MoE 2,7B fonctionnel pour environ 200 $. Des bénévoles ont fait passer un témoin d'entraînement sur le Hugging Face Hub, un GPU loué à la fois, avec un bail compare-and-swap pour que jamais deux personnes n'entraînent la même étape.

2026-08-04

LLM & Modèles4 min read

Distillation des LLM

La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer

Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.

2026-07-31

IAFeatured3 min read

Optimisation de l’entraînement

Unsloth prétend accélérer 5 fois l’entraînement des LLM avec de nouveaux noyaux Triton et un auto-packing

La dernière mise à jour d’Unsloth introduit des noyaux QK RoPE Triton fusionnés pour des embeddings rotatifs 2,3 fois plus rapides, un indexage int64 pour les longs contextes et un packing sans padding. Les benchmarks montrent un débit 1,7 à 3 fois supérieur sur Qwen3-32B sans perte de précision.

2026-07-16

LLM & Modèles4 min read

Stratégie de données synthétiques

L'atlas de données de Nvidia montre pourquoi les données synthétiques importent plus que les poids des modèles

L'Atlas de prompts Nemotron Post-Training v3 de Nvidia fournit une carte interactive de milliards d'échantillons de données synthétiques, soulignant comment les données synthétiques ouvertes constituent la couche manquante pour construire des agents IA fiables. L'entreprise affirme que le comportement des agents doit être inspectable et que les données synthétiques, publiées ouvertement, sont le seul moyen de préserver les signaux propriétaires sans exposer les secrets commerciaux.

2026-07-12