SevenTnewS

AI研究

11 published articles

人工智能3 min read

TRACTA基准

基准测试发现:神经符号推理在时序任务上优于纯神经模型

TRACTA基准揭示,神经符号AI在三个时序推理任务上击败纯神经模型,在早期预警和模式检测任务上差距最大。

2026-08-02

人工智能4 min read

人工智能

为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题

麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。

2026-07-29

实验室与研究4 min read

人工智能研究

SoftReason弥合了阻止神经网络真正推理的梯度鸿沟

SoftReason是一种用于演绎推理的完全可微的神经-软-符号架构。它消除了感知与推理之间的梯度障碍,实现了在高维感知数据和知识图谱三元组上的端到端训练。在KVQA上测试,展示了软推理如何统一基础推理、证据注入和闭包。

2026-07-26

大语言模型与模型4 min read

多模态AI

为什么视觉语言模型需要一个视觉中继窗来停止幻觉

新研究揭示了VLM中稳定三阶段多模态注意力再分配,并将其操作化为视觉中继窗(VRW)。TRACE框架使用轻量级训练模块按任务调度此窗口,在接地敏感基准测试中平均提高4.33个百分点,最高达6.6个百分点。

2026-07-23

大语言模型与模型Featured4 min read

AI研究

Qwen-music以旋律为中心,效果不言自明

Qwen-Music通过先明确规划旋律再生成完整歌曲的方式开辟新天地,该团队称之为Melody-CoT的方法。该模型在16项客观指标中的13项达到了最先进水平,并且在盲测中击败了Suno V5和MiniMax Music 2.6。

2026-07-20

人工智能Featured3 min read

人工智能研究

避免LLM智能体在生产环境中崩溃的噪声技巧

当前的LLM智能体在现实世界的随机性面前不堪一击。NoisyAgent在训练过程中让它们暴露于受控噪声中,从而提升了鲁棒性和通用基准性能。该论文指出,该领域可能已在无噪声条件上过拟合。

2026-07-17

大语言模型与模型4 min read

人工智能

阿里巴巴开源世界模型:让AI智能体在模拟器中训练

阿里巴巴Qwen团队发布Qwen-AgentWorld,一种语言世界模型,能在七个领域模拟智能体环境。其CPT、SFT、RL三阶段流程构建出一个在保真度上击败GPT-5.4的模拟器,使智能体能够通过心理排练而非昂贵的真实环境展开进行训练。

2026-07-16

开源4 min read

开源

Ai2 打开了AI柜子里的每一个抽屉,这是里面的内容

Ai2 发布了 Olmo 3,一个从 7B 到 32B 的完全开源模型系列,包括训练数据、代码和工具。此次发布强调了从预培训数据到后培训管道的整个模型生命周期的透明度,为开源AI研究树立了新标准。

2026-07-11

人工智能5 min read

数学推理

M3团队找到阻止AI数学验证器作弊的方法,这为每个实验室提供了蓝图

M3的数学推理方法结合了三个专家模型:Proof(证明)、Verifier(验证器)和Fixed(修正),并搭配一个进化搜索框架。该报告提供了关于奖励黑客攻击、验证器对齐以及使生成式验证器在高风险推理任务中可靠所需的工程细节的罕见详述。

2026-07-11

实验室与研究4 min read

深度解读新鲜预印本

五天前刚发布的论文2606.23050,告诉我们AI的未来走向

一份33页的预印本论文2606.23050,五天前发布,标志着对AI研究的重要贡献。本文解析其方法论、关键发现以及对机器学习和自然语言处理发展轨迹的启示。

2026-07-07

开源3 min read

开源创新

Hugging Face 的 Moon Bot 将 Slack 变成编码代理,而这只是本周的动态

Moon Bot 将 AI 辅助编码直接带入 Slack 工作流,而 VLX-Flow 和 VLX-Seek 则致力于实时视频理解和细粒度感知。其他亮点包括医学编码器预训练方案、Qwen 上的 QLORA 蒸馏实验,以及一个用于机器学习的星际基准。

2026-06-29