SevenTnewS

MLX

5 published articles

Meta AI3 min read

开源 AI

Meta 的 30B Muse Glimmer 率先登陆 Apple Silicon,NVIDIA 支持随后跟上

Meta 发布了 Muse Glimmer,一款面向 agent 工作负载的 30B 开放权重多模态模型,Ollama 同一天在 Apple Silicon 上提供了支持。DFlash 使其在 Mac 硬件上快 1.5 到 1.8 倍。NVIDIA 和 AMD 支持将在未来几天内跟进。

2026-08-13

AndroidFeatured1 min read

移动AI

Gemma 4 完全离线运行于移动设备,无需云端

React Native 开发者现在可以嵌入 Gemma 4,在 Android 和 iOS 上通过硬件加速实现离线推理。该模型本地处理视觉和工具使用任务,如演示中所示,完全在设备端读取传单并安排日历事件。

2026-07-09

基准与测试Featured3 min read

性能

Gemma 4 在 Ollama 0.31 中通过多令牌预测实现近 90% 的性能提升

Ollama 0.31 为 Apple Silicon 上的 Gemma 4 引入了多令牌预测,在编码基准测试中实现了近 90% 的令牌生成速度提升。加速来自一个自动调优的草稿模型和一个消除冗余权重读取的自定义 MLX 内核。

2026-06-29

Vibe编程Featured3 min read

性能更新

Ollama的MLX引擎在Apple Silicon上速度更快、内存占用更低

Ollama的MLX引擎更新带来了NVFP4量化,以实现更高质量的4位模型;通过融合Metal内核使推理速度提升20%;以及一个快照缓存系统,可消除多代理、思维模型和分支场景中共享上下文的重复处理。

2026-06-11

人工智能Featured4 min read

本地AI推理

Ollama重写Apple芯片引擎:M5时代才是真正的主角

Ollama预览MLX支持的Apple芯片推理,将Qwen3.5-35B-A3B模型在M5上的预填充速度推至1,851 tok/s。该版本还引入NVFP4量化以保证生产级一致性,并为代理工作流提供更智能的缓存机制。

2026-03-30