arXiv
18 published articles
视觉与扩散4 min read
计算机视觉、世界模型与AI研究
PhiZero:在渲染前教视频AI用物理规律思考
PhiZero是CASIA的世界模型,它从原始视频中学习一种紧凑的离散“物理语言”,并在渲染帧之前用这种语言推理场景将如何演变。作者认为,这种先推理后渲染的设计比直接预测像素能产生物理上更一致的视频。
2026-07-31
视觉与扩散4 min read
AI 研究
VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理
VideoCoCo 将可执行的 Blender 代码视为思维链:编码代理编写场景脚本,模拟器将其演绎出来,视频引擎让结果达到照片级逼真。这种分工针对文生视频的物理问题,并在 PhyGenBench 和 VBench-2.0 上取得了最佳平均分。
2026-07-30
人工智能3 min read
人工智能
更好的AI检测器可能会让人们更多地使用AI,而不是更少
不完善的LLM检测器会扭曲用户激励,导致AI使用增加和输出质量下降。该论文的发现挑战了检测工具能干净地减少机器生成内容这一天真假设。
2026-07-26
基准与测试4 min read
基准测试
大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理
SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。
2026-07-25
大语言模型与模型4 min read
AI研究
四种人格,一个答案:为何异构推理在最难人类测试中击败了最佳AI
PoTRE将推理分解为四个并行工作的代理,然后动态调和它们的答案。它在人类终极考试上达到49.92%,超过了之前的官方最佳成绩。该方法使用的令牌比扩展的基线更少。
2026-07-24
NLP与机器学习Featured4 min read
AI研究
为何GPT-5.5在测试智能体自我改进能力的基准测试中占据主导
EvoPolicyGym 隔离了一个关键但研究不足的能力:智能体通过反复受限反馈编辑来完善可执行策略的能力。该基准测试显示 GPT-5.5 在 16 个环境中表现最强,并提供了轨迹级诊断,揭示了不同智能体如何分配预算以及如何将反馈转化为调优参数。
2026-07-11