MLX
5 published articles
IA open source
Le Muse Glimmer 30B de Meta arrive en premier sur Apple Silicon, le support NVIDIA suivra
Meta a publié Muse Glimmer, un modèle multimodal à poids ouverts de 30B conçu pour les charges de travail d'agents, et Ollama l'a diffusé pour Apple Silicon le même jour. DFlash le rend 1,5 à 1,8 fois plus rapide sur les Mac. Les supports NVIDIA et AMD suivront dans les prochains jours.
2026-08-13
IA mobile
Gemma 4 fonctionne désormais entièrement hors ligne sur mobile, sans cloud requis
Les développeurs React Native peuvent désormais intégrer Gemma 4 pour une inférence hors ligne avec accélération matérielle sur Android et iOS. Le modèle gère localement des tâches de vision et d’utilisation d’outils, comme le montre la lecture d’un dépliant et la planification d’un événement de calendrier entièrement sur l’appareil.
2026-07-09
Performances
Gemma 4 tourne presque 90 % plus vite dans Ollama 0.31 avec la prédiction multi-tokens
Ollama 0.31 introduit la prédiction multi-tokens pour Gemma 4 sur Apple Silicon, atteignant près de 90 % de génération de tokens plus rapide sur les benchmarks de codage. L'accélération provient d'un modèle de brouillon auto-ajusté et d'un noyau MLX personnalisé qui élimine les lectures redondantes de poids.
2026-06-29
Mise à jour des performances
Le moteur MLX d'Ollama est désormais plus rapide et moins gourmand en mémoire sur Apple Silicon
La mise à jour du moteur MLX d'Ollama apporte la quantification NVFP4 pour des modèles 4 bits de meilleure qualité, une inférence 20 % plus rapide grâce aux noyaux Metal fusionnés et un système de cache d'instantanés qui élimine le retraitement du contexte partagé dans les scénarios multi-agents, de modèles de réflexion et de branchement.
2026-06-11
Inférence IA locale
Ollama vient de réécrire son moteur Apple silicon. La génération M5 est la véritable histoire
Ollama présente en aperçu l'inférence basée sur MLX sur Apple silicon, poussant Qwen3.5-35B-A3B à 1 851 tok/s en préremplissage sur M5. Le passage apporte également la quantification NVFP4 pour une parité de production et un cache plus intelligent pour les workflows agentiques.
2026-03-30