SevenTnewS

Annonces

L'actualité tech en une phrase — le fait le plus marquant de chaque article publié.

Qwen / 阿里巴巴23 juil. 2026

阿里巴巴云发布了Qwen-Coder-Qoder,一个从用户交互中学习的编码模型,击败了Cursor Composer-1,错误率降低61.5%,令牌消耗减少14.5%

人工智能23 juil. 2026

AlayaLab研究人员认为,生成模型需要显式状态管理来创建持久的AI生成游戏世界,并提出一个框架和90-h

Mistral AI23 juil. 2026

Sakana AI将NVIDIA的Nemotron模型集成到Fugu中,以测试协调的开放模型集群能否与单一的前沿系统相媲美。

开源22 juil. 2026

阿里巴巴开源项目Nacos Skill Sync统一了多个AI编码代理的技能管理,解决了碎片化和陈旧规则集问题。

人工智能22 juil. 2026

GPT-5.6 Sol 在 LiveBench 上以 82.4 分位居榜首,但 Claude Fable 5 仅落后 1.6 分,成本却接近其三倍,揭示了顶级模型之间残酷的价格差距。

网络安全22 juil. 2026

Anthropic推出了Claude Security,一款企业工具,用于扫描代码中的漏洞,通过对抗性测试验证发现以减少误报,一个

人工智能22 juil. 2026

GitHub 于周二将一个获得4万星的开源项目转化为 Copilot 的原生技能,以生成既有效又设计良好的代码。

人工智能22 juil. 2026

Moonshot AI的开源权重模型Kimi K3在一个交易日内抹去了OpenAI和Anthropic预期估值中的3140亿美元,证明了前沿AI可以以远低于预期的成本构建。

人工智能22 juil. 2026

MiniMax的VTP框架通过用语义理解替代像素重建标记器训练来改进图像生成,实现了65.8%的FID改进。

Mistral AI22 juil. 2026

Mistral AI 将 Le Chat 更名为 Vibe,统一其 AI 代理,使其能够在单一平台上同时处理企业工作流程和软件开发。

工具与框架22 juil. 2026

PraisonAI 声称能够以 14 微秒实例化智能体,并支持 24 个 LLM,旨在取代 LangChain 和 CrewAI,但缺乏生产环境下的验证。

人工智能22 juil. 2026

一个多学科团队提出了一种基于整合信息理论的可测试框架,用于判断人工智能是否可能变得有感知能力,这对伦理具有影响

基准与测试22 juil. 2026

AgentScope的PawBench基准测试,在150个任务上测试了9个模型,揭示出框架设计可以使得分波动超过11个百分点,显示框架更加重要

AI代理22 juil. 2026

加州大学圣地亚哥分校和Aether AI Lab的研究人员开发了StructAgent,这是一个以状态为中心的框架,它将AI代理在桌面任务上的成功率从27%提高到47%。

Sakana AI22 juil. 2026

Sakana AI的类脑神经网络研究显示,关键组件在MNIST和CIFAR之间翻转,警示了对单一基准评估的依赖。

人工智能22 juil. 2026

Google Vids新增Gemini Omni,支持文本生成视频和个人虚拟形象,用户无需摄像头即可出演视频,并采用SynthID水印确保真实性。

人工智能22 juil. 2026

并行代理承诺速度和专业化,但若架构缺乏任务分解和状态隔离,则会失败——据Kimi Agent Swarm的分析。

人工智能21 juil. 2026

谷歌于7月21日发布了三款新的Gemini模型:更便宜的Flash、更快的Lite,以及仅限政府使用的网络安全变体,旨在提高令牌效率和延迟

人工智能21 juil. 2026

Poolside的33B参数Laguna XS 2.1在编程基准测试中击败137B模型,在不改变硬件的情况下,在SWE-bench Multilingual上达到63.1%。

人工智能21 juil. 2026

Sakana AI发布了Fugu-Cyber,一个匹配前沿基准的多智能体网络模型,但警告称仅凭此模型无法解决企业安全问题。

← PrécédentPage 3 / 4 · 67 annoncesSuivant →