Annonces
L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.
OpenCode 达到 4000 万美元年经常性收入(ARR)和 460 万周活跃用户,此前 Anthropic 对 Claude 的限制促使开发者转向其开源 AI 编程智能体,CEO Jay V 在 YC 播客中表示。
Anthropic的Claude Opus 5在基准测试中几乎与其旗舰产品Fable 5持平,价格仅为一半,但故意削弱了网络安全能力。
微软的MAI模型在必应和Office中上线,将GPU成本降低84-89%,改变了AI成本的计算方式。
阿里巴巴的 0.8B 参数 OvisOCR2 端到端模型在 OmniDocBench 上以 96.58 分击败了所有流水线文档解析器。
谷歌的Gemini 3.5 Flash Cyber,一个轻量级微调模型且仅限政府使用,发现了55个V8漏洞,而Claude Opus 4.6发现了36个。
Hugging Face 彻底改造其 Inference Endpoints 服务,以降低部署复杂性,提供 vLLM、SGLang 和自定义容器,并支持自动缩放和按需付费-
OpenRTAG,一个来自研究人员的新基准,揭示了文本属性图模型如何在脏数据上失败,统一了九个数据集上的九个退化场景
PRO-LONG,一个2026年7月发布的框架,利用程序化记忆让LLM智能体回忆47步之前的操作,将ARC-AGI-3的通过率提升了18个百分点。
一篇新的arXiv论文将LangGraph重新定位为工作流编排工具,而非AI基准,并提供了三个用于有状态进程的可执行方案。
Voxtral TTS,一种新的混合文本转语音模型,在语音克隆中以68.4%的胜率击败ElevenLabs Flash v2.5,并开放其权重。
研究人员的新教程揭示了学术基准未捕捉到的LLM Agent生产失败,缓解措施包括验证管道等
PoTRE,一种使用四个专门推理代理的新AI框架,通过证明思维多样性优于单纯的模型规模,在人类最后考试中取得了49.92%的准确率。
阿里巴巴ATH的HappyOyster 1.0能够从一张照片或文本提示构建可驾驶的3D世界,目前处于灰度测试阶段。
研究人员通过人工损伤AI模型,再现了中风引起的失语症命名错误,并以高精度匹配了个体患者的行为模式。
Qwen Cloud 推出了 Token Plan Individual 和 Team 层级,捆绑 AI 模型以削减 40% 成本,并与 Claude Code 和 Cline 集成。
研究人员构建了一个通过巴甫洛夫条件反射学习情感关联的神经网络,能够再现类似人类的图像偏好。
谷歌DeepMind的Gemma 4下载量突破3亿次,表明开放权重模型如今在成本上已超越专有API。
7月22日arXiv研究显示,自然语言自编码器尽管有98%的错误声明,仍能通过重构测试;RECAP在可验证解释上达到AUC 0.95。
OpenCode免费添加inclusionAI的Ling 3.0 Flash,押注token效率赢得AI编程战争。
Sakana AI 发布了 Fugu Ultra 1.1,这是一个路由层,通过单个 API 隐藏了处理你提示的 AI 模型,以降低成本和复杂性。