Annonces
L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.
xAI的Grok Build CLI发布了20+个bug修复和一个教程,而不是一个新功能,而Apple的Xcode 27现在原生支持来自Anthropic, G的编程智能体
xAI发布了Grok Build CLI v0.2.112,包含超过20个bug修复、一个/tutorial命令、可配置的搜索工具覆盖以及失败运行的工作流恢复。
Celeris团队声称其Celeris-1模型在158毫秒延迟下达到MMLU-Pro 75.9%的准确率,挑战了推理速度与质量之间的权衡。
Atomic.chat测试了Opus 5、Fable 5、Kimi K3和GPT 5.6构建3D破坏场景的情况;Opus 5以1.40美元通过了全部三个,而Fable以2.82美元失败。
OpenCode 达到 4000 万美元年经常性收入(ARR)和 460 万周活跃用户,此前 Anthropic 对 Claude 的限制促使开发者转向其开源 AI 编程智能体,CEO Jay V 在 YC 播客中表示。
Anthropic的Claude Opus 5在基准测试中几乎与其旗舰产品Fable 5持平,价格仅为一半,但故意削弱了网络安全能力。
微软的MAI模型在必应和Office中上线,将GPU成本降低84-89%,改变了AI成本的计算方式。
阿里巴巴的 0.8B 参数 OvisOCR2 端到端模型在 OmniDocBench 上以 96.58 分击败了所有流水线文档解析器。
谷歌的Gemini 3.5 Flash Cyber,一个轻量级微调模型且仅限政府使用,发现了55个V8漏洞,而Claude Opus 4.6发现了36个。
Hugging Face 彻底改造其 Inference Endpoints 服务,以降低部署复杂性,提供 vLLM、SGLang 和自定义容器,并支持自动缩放和按需付费-
OpenRTAG,一个来自研究人员的新基准,揭示了文本属性图模型如何在脏数据上失败,统一了九个数据集上的九个退化场景
PRO-LONG,一个2026年7月发布的框架,利用程序化记忆让LLM智能体回忆47步之前的操作,将ARC-AGI-3的通过率提升了18个百分点。
一篇新的arXiv论文将LangGraph重新定位为工作流编排工具,而非AI基准,并提供了三个用于有状态进程的可执行方案。
Voxtral TTS,一种新的混合文本转语音模型,在语音克隆中以68.4%的胜率击败ElevenLabs Flash v2.5,并开放其权重。
研究人员的新教程揭示了学术基准未捕捉到的LLM Agent生产失败,缓解措施包括验证管道等
PoTRE,一种使用四个专门推理代理的新AI框架,通过证明思维多样性优于单纯的模型规模,在人类最后考试中取得了49.92%的准确率。
阿里巴巴ATH的HappyOyster 1.0能够从一张照片或文本提示构建可驾驶的3D世界,目前处于灰度测试阶段。
研究人员通过人工损伤AI模型,再现了中风引起的失语症命名错误,并以高精度匹配了个体患者的行为模式。
Qwen Cloud 推出了 Token Plan Individual 和 Team 层级,捆绑 AI 模型以削减 40% 成本,并与 Claude Code 和 Cline 集成。
研究人员构建了一个通过巴甫洛夫条件反射学习情感关联的神经网络,能够再现类似人类的图像偏好。