SevenTnewS

Annonces

L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.

人工智能25 juil. 2026

xAI的Grok Build CLI发布了20+个bug修复和一个教程,而不是一个新功能,而Apple的Xcode 27现在原生支持来自Anthropic, G的编程智能体

工具与框架25 juil. 2026

xAI发布了Grok Build CLI v0.2.112,包含超过20个bug修复、一个/tutorial命令、可配置的搜索工具覆盖以及失败运行的工作流恢复。

人工智能25 juil. 2026

Celeris团队声称其Celeris-1模型在158毫秒延迟下达到MMLU-Pro 75.9%的准确率,挑战了推理速度与质量之间的权衡。

大语言模型与模型25 juil. 2026

Atomic.chat测试了Opus 5、Fable 5、Kimi K3和GPT 5.6构建3D破坏场景的情况;Opus 5以1.40美元通过了全部三个,而Fable以2.82美元失败。

AI代理24 juil. 2026

OpenCode 达到 4000 万美元年经常性收入(ARR)和 460 万周活跃用户,此前 Anthropic 对 Claude 的限制促使开发者转向其开源 AI 编程智能体,CEO Jay V 在 YC 播客中表示。

大语言模型与模型24 juil. 2026

Anthropic的Claude Opus 5在基准测试中几乎与其旗舰产品Fable 5持平,价格仅为一半,但故意削弱了网络安全能力。

人工智能24 juil. 2026

微软的MAI模型在必应和Office中上线,将GPU成本降低84-89%,改变了AI成本的计算方式。

大语言模型与模型24 juil. 2026

阿里巴巴的 0.8B 参数 OvisOCR2 端到端模型在 OmniDocBench 上以 96.58 分击败了所有流水线文档解析器。

网络安全24 juil. 2026

谷歌的Gemini 3.5 Flash Cyber,一个轻量级微调模型且仅限政府使用,发现了55个V8漏洞,而Claude Opus 4.6发现了36个。

人工智能24 juil. 2026

Hugging Face 彻底改造其 Inference Endpoints 服务,以降低部署复杂性,提供 vLLM、SGLang 和自定义容器,并支持自动缩放和按需付费-

基准与测试24 juil. 2026

OpenRTAG,一个来自研究人员的新基准,揭示了文本属性图模型如何在脏数据上失败,统一了九个数据集上的九个退化场景

人工智能24 juil. 2026

PRO-LONG,一个2026年7月发布的框架,利用程序化记忆让LLM智能体回忆47步之前的操作,将ARC-AGI-3的通过率提升了18个百分点。

工具与框架24 juil. 2026

一篇新的arXiv论文将LangGraph重新定位为工作流编排工具,而非AI基准,并提供了三个用于有状态进程的可执行方案。

人工智能24 juil. 2026

Voxtral TTS,一种新的混合文本转语音模型,在语音克隆中以68.4%的胜率击败ElevenLabs Flash v2.5,并开放其权重。

人工智能24 juil. 2026

研究人员的新教程揭示了学术基准未捕捉到的LLM Agent生产失败,缓解措施包括验证管道等

大语言模型与模型24 juil. 2026

PoTRE,一种使用四个专门推理代理的新AI框架,通过证明思维多样性优于单纯的模型规模,在人类最后考试中取得了49.92%的准确率。

人工智能24 juil. 2026

阿里巴巴ATH的HappyOyster 1.0能够从一张照片或文本提示构建可驾驶的3D世界,目前处于灰度测试阶段。

NLP与机器学习24 juil. 2026

研究人员通过人工损伤AI模型,再现了中风引起的失语症命名错误,并以高精度匹配了个体患者的行为模式。

Qwen / 阿里巴巴24 juil. 2026

Qwen Cloud 推出了 Token Plan Individual 和 Team 层级,捆绑 AI 模型以削减 40% 成本,并与 Claude Code 和 Cline 集成。

人工智能24 juil. 2026

研究人员构建了一个通过巴甫洛夫条件反射学习情感关联的神经网络,能够再现类似人类的图像偏好。

← PrécédentPage 1 / 4 · 63 annoncesSuivant →