Inférence CPU
2 published articles
IA4 min read
Edge AI
Le runtime exclusivement CPU d'Audio8 fait tenir le clonage vocal dans environ 1 Gio de RAM
Le runtime ONNX d'Audio8 exécute la préversion TTS 0.6B entièrement sur CPU : poids autorégressifs INT4, codec 44,1 kHz intégré, PCM en streaming et endpoint compatible OpenAI. Le service occupe environ 1 Gio de RAM sur un ordinateur portable, et ni PyTorch ni Transformers ne sont nécessaires à l'exécution.
2026-08-05
LLM & Modèles5 min read
Intelligence artificielle
Les LFM2.5-Encoders plaident pour les petits modèles : 3,7× plus rapides que ModernBERT sur CPU
Les LFM2.5-Encoders open-weight de Liquid AI plaident pour une NLP de production confiée aux petits modèles. Un encodeur de 230M bat ModernBERT-base sur les benchmarks et analyse des documents complets en environ 28 secondes sur un CPU d'ordinateur portable, soit environ 3,7× plus vite.
2026-08-05