Annonces
L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.
一个多学科团队提出了一种基于整合信息理论的可测试框架,用于判断人工智能是否可能变得有感知能力,这对伦理具有影响
AgentScope的PawBench基准测试,在150个任务上测试了9个模型,揭示出框架设计可以使得分波动超过11个百分点,显示框架更加重要
加州大学圣地亚哥分校和Aether AI Lab的研究人员开发了StructAgent,这是一个以状态为中心的框架,它将AI代理在桌面任务上的成功率从27%提高到47%。
Sakana AI的类脑神经网络研究显示,关键组件在MNIST和CIFAR之间翻转,警示了对单一基准评估的依赖。
Google Vids新增Gemini Omni,支持文本生成视频和个人虚拟形象,用户无需摄像头即可出演视频,并采用SynthID水印确保真实性。
并行代理承诺速度和专业化,但若架构缺乏任务分解和状态隔离,则会失败——据Kimi Agent Swarm的分析。
谷歌于7月21日发布了三款新的Gemini模型:更便宜的Flash、更快的Lite,以及仅限政府使用的网络安全变体,旨在提高令牌效率和延迟
Poolside的33B参数Laguna XS 2.1在编程基准测试中击败137B模型,在不改变硬件的情况下,在SWE-bench Multilingual上达到63.1%。
Sakana AI发布了Fugu-Cyber,一个匹配前沿基准的多智能体网络模型,但警告称仅凭此模型无法解决企业安全问题。
OpenCode 通过新的 Gemini 3.5 Flash Lite 模型以及 Gemini 3.6 Flash 将 AI 编码成本降低 80%,旨在使 AI 编码成为团队的默认选择。
一个面向专业人士的实用指南,讲解了如何为Claude构建提示词,以避免答案相关性减半。
Gemini 3.6 flash泄漏测试,未见预期中的3.5 pro,暗示Google DeepMind路线图调整。
UPI Help的新分层智能体架构通过使用技能树和LIFO堆栈,将每次调用的上下文令牌减少96%,同时保持完美的路由准确性
xAI 的 Grok 现在可以在无需监督的情况下运行定时和电子邮件触发的任务,在 grok.com 和移动应用上充当一个持续的个人助手,电子邮件触发功能为 SuperGrok 用户专属。
谷歌在健康AI领域将覆盖范围置于准确性之上,以Med-Gemini 91.1%的考试成绩为后盾,在印度和泰国提供数百万次免费糖尿病视网膜病变筛查
欧盟要求谷歌在2027年7月前根据DMA开放Android给竞争对手的AI助手,但拒绝了苹果对Siri的相同宽限期,凸显了谷歌更优的监管策略