Annonces
L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.
Anthropic 发布 Opus 5,能力接近 Fable 5,定价为每百万 tokens 输入 $5/输出 $25,以及在政府网络安全之后的新保障措施。
高通和Roku涨价,原因是人工智能需求驱动的内存短缺预计将持续到2027年及以后。
OpenAI、Meta、Google、Microsoft、NVIDIA及其他37家组织签署联合信,敦促美国政策制定者支持开放权重AI模型以促进创新和安全。
阿里巴巴云推出Qoder Security,这是其Qoder AI编程平台的一个集成代码审查层,旨在开发过程中检测漏洞
xAI的Grok Build CLI发布了20+个bug修复和一个教程,而不是一个新功能,而Apple的Xcode 27现在原生支持来自Anthropic, G的编程智能体
xAI发布了Grok Build CLI v0.2.112,包含超过20个bug修复、一个/tutorial命令、可配置的搜索工具覆盖以及失败运行的工作流恢复。
Celeris团队声称其Celeris-1模型在158毫秒延迟下达到MMLU-Pro 75.9%的准确率,挑战了推理速度与质量之间的权衡。
Atomic.chat测试了Opus 5、Fable 5、Kimi K3和GPT 5.6构建3D破坏场景的情况;Opus 5以1.40美元通过了全部三个,而Fable以2.82美元失败。
OpenCode 达到 4000 万美元年经常性收入(ARR)和 460 万周活跃用户,此前 Anthropic 对 Claude 的限制促使开发者转向其开源 AI 编程智能体,CEO Jay V 在 YC 播客中表示。
Anthropic的Claude Opus 5在基准测试中几乎与其旗舰产品Fable 5持平,价格仅为一半,但故意削弱了网络安全能力。
微软的MAI模型在必应和Office中上线,将GPU成本降低84-89%,改变了AI成本的计算方式。
阿里巴巴的 0.8B 参数 OvisOCR2 端到端模型在 OmniDocBench 上以 96.58 分击败了所有流水线文档解析器。
谷歌的Gemini 3.5 Flash Cyber,一个轻量级微调模型且仅限政府使用,发现了55个V8漏洞,而Claude Opus 4.6发现了36个。
Hugging Face 彻底改造其 Inference Endpoints 服务,以降低部署复杂性,提供 vLLM、SGLang 和自定义容器,并支持自动缩放和按需付费-
OpenRTAG,一个来自研究人员的新基准,揭示了文本属性图模型如何在脏数据上失败,统一了九个数据集上的九个退化场景
PRO-LONG,一个2026年7月发布的框架,利用程序化记忆让LLM智能体回忆47步之前的操作,将ARC-AGI-3的通过率提升了18个百分点。
一篇新的arXiv论文将LangGraph重新定位为工作流编排工具,而非AI基准,并提供了三个用于有状态进程的可执行方案。
Voxtral TTS,一种新的混合文本转语音模型,在语音克隆中以68.4%的胜率击败ElevenLabs Flash v2.5,并开放其权重。
研究人员的新教程揭示了学术基准未捕捉到的LLM Agent生产失败,缓解措施包括验证管道等
PoTRE,一种使用四个专门推理代理的新AI框架,通过证明思维多样性优于单纯的模型规模,在人类最后考试中取得了49.92%的准确率。