SevenTnewS

NVFP4

4 published articles

IA5 min read

Infrastructure IA

Nemotron 3 Embed de Nvidia expose la taxe cachée que chaque agent IA paie

Nvidia a publié Nemotron 3 Embed, une famille de modèles d'embedding open-weight qui atteignent une qualité de récupération de pointe tout en réduisant les coûts en tokens des agents en aval. La variante 8B se classe n°1 sur RTEB ; les modèles plus petits de 1B offrent une efficacité prête pour la production.

2026-07-16

VibeCodingFeatured3 min read

Mise à jour des performances

Le moteur MLX d'Ollama est désormais plus rapide et moins gourmand en mémoire sur Apple Silicon

La mise à jour du moteur MLX d'Ollama apporte la quantification NVFP4 pour des modèles 4 bits de meilleure qualité, une inférence 20 % plus rapide grâce aux noyaux Metal fusionnés et un système de cache d'instantanés qui élimine le retraitement du contexte partagé dans les scénarios multi-agents, de modèles de réflexion et de branchement.

2026-06-11

IAFeatured5 min read

Infrastructure IA

Le nouveau Nemotron 3 Ultra de Nvidia bouleverse l'équation des coûts des workflows agentiques

Nemotron 3 Ultra, le modèle dense-creux agentique de Nvidia, promet de réduire les coûts d'inférence jusqu'à 30 % par rapport aux modèles ouverts équivalents tout en conservant un raisonnement de pointe. Avec une fenêtre de contexte d'un million de jetons et une quantification NVFP4 native, il est positionné comme le cheval de bataille pour les charges de travail d'appel d'outils en entreprise.

2026-06-04

IAFeatured4 min read

Inférence IA locale

Ollama vient de réécrire son moteur Apple silicon. La génération M5 est la véritable histoire

Ollama présente en aperçu l'inférence basée sur MLX sur Apple silicon, poussant Qwen3.5-35B-A3B à 1 851 tok/s en préremplissage sur M5. Le passage apporte également la quantification NVFP4 pour une parité de production et un cache plus intelligent pour les workflows agentiques.

2026-03-30