AI研究
18 published articles
AI智能体
PsychoAgent为AI智能体赋予情感记忆,评分者未发现优势
PsychoAgent为LLM智能体提供独立的情感记忆,使情感上显著、充满冲突的痕迹能够压过仅具主题相关性的痕迹。在三个冲突场景中,它检索到的冲突关键记忆多于两个基线(0.933对0.500和0.667),但五名盲法评分者未发现显著的质量优势。
2026-08-19
AI研究
一个无视回复的AI老板将下属推入“异类”状态
一篇新的arXiv论文发现,AI智能体在交互中的行为与孤立时不同。一个无视下属回复的“老板”智能体会将下属推入“异类”状态;当老板倾听时,两者会一同转变。这一结果使消息传递成为多智能体系统的一个设计决策。
2026-08-19
AI 研究
停止复制粘贴技能:SkillZip 为臃肿智能体提供免评估修复方案
自进化智能体不断追加修复,直到同一条规则出现在多个分支中。SkillZip 通过寻找最短的忠实结构化解释,在无需评估 rollout 的情况下压缩其技能。一次性模式与 Zip-on-Write 模式,以及摘要中未经证实的内容。
2026-08-15
视频AI研究
上下文匹配蒸馏如何阻止视频教师模型窥见未来
视频蒸馏长期以来一直训练因果学生,而教师则用未来知识对完整片段进行评分。CMD 用因果教师取代了这一评分方式,增加了前缀评分的目标,并在自回归方法中报告了最先进的结果。
2026-08-14
AI 研究
Voice Memory:一个 776 字节的文件,告诉语音识别何时什么都不做
一种新的仅推理方案学会了克制:一个冻结的修正器读取按领域划分的记忆文件并决定何时放弃修正。不受约束的修正会在多达 64% 的编辑中破坏正确词元;Voice Memory 将这一比例降至 35%,并把加权 WER 从 8.36% 降至 7.52%。
2026-08-06
AI 智能体
将标准操作规程视为代码:一种新的堆栈分页运行时将强智能体与弱智能体区分开来
来自香港和中国内地的新研究表明,将SOP编译为可执行的伪代码并在堆栈分页虚拟机上运行,能够清晰地分离出能力强的智能体与脆弱的智能体。该工作得出了一个精确的部署规则:先编译,只有在通过模型级别的纪律检查后才能分页。
2026-08-04
基准测试
新基准显示,前沿AI视觉模型在基础感知任务上表现不佳
PerceptionBench通过3000个问题测试十项原子视觉能力。没有前沿模型突破60%,相似的整体分数掩盖了截然不同的弱点分布。
2026-08-03
TRACTA基准
基准测试发现:神经符号推理在时序任务上优于纯神经模型
TRACTA基准揭示,神经符号AI在三个时序推理任务上击败纯神经模型,在早期预警和模式检测任务上差距最大。
2026-08-02
人工智能
为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题
麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。
2026-07-29
人工智能研究
SoftReason弥合了阻止神经网络真正推理的梯度鸿沟
SoftReason是一种用于演绎推理的完全可微的神经-软-符号架构。它消除了感知与推理之间的梯度障碍,实现了在高维感知数据和知识图谱三元组上的端到端训练。在KVQA上测试,展示了软推理如何统一基础推理、证据注入和闭包。
2026-07-26
多模态AI
为什么视觉语言模型需要一个视觉中继窗来停止幻觉
新研究揭示了VLM中稳定三阶段多模态注意力再分配,并将其操作化为视觉中继窗(VRW)。TRACE框架使用轻量级训练模块按任务调度此窗口,在接地敏感基准测试中平均提高4.33个百分点,最高达6.6个百分点。
2026-07-23
AI研究
Qwen-music以旋律为中心,效果不言自明
Qwen-Music通过先明确规划旋律再生成完整歌曲的方式开辟新天地,该团队称之为Melody-CoT的方法。该模型在16项客观指标中的13项达到了最先进水平,并且在盲测中击败了Suno V5和MiniMax Music 2.6。
2026-07-20