NLP与机器学习
自然语言处理、机器学习和深度学习
15 published articles
联邦学习
当用户无法共享时,FedCGR 转而共享一种语言
FedCGR 将联邦跨域推荐视为在稳定的语义物品语言上的生成任务。物品变成从公开元数据中提取的离散语义 ID,因此客户端无需交换私有交互即可对齐。代价是:一个仅含语义的瓶颈,需要本地协同过滤证据来填补。
2026-08-18
知识图谱与城市AI
站点不是孤岛:RTSKG如何重构城市交通数据
城市级交通模型往往忽略站点与道路和商业设施之间的关系。RTSKG是发布在arXiv上的知识图谱数据集,它显式地建模这些互动,并报告在店铺推荐和客流预测上的收益。
2026-08-18
RAG研究
当语料库超过1000万token时,BM25胜过智能体式RAG
智能体式搜索在小语料库上占优,但muset-ai一项覆盖28个嵌套层级的研究显示,BM25在接近1000万token时超越它。智能体消耗39倍的查询token,图RAG则在构建阶段停滞。
2026-08-07
AI 研究
Voice Memory:一个 776 字节的文件,告诉语音识别何时什么都不做
一种新的仅推理方案学会了克制:一个冻结的修正器读取按领域划分的记忆文件并决定何时放弃修正。不受约束的修正会在多达 64% 的编辑中破坏正确词元;Voice Memory 将这一比例降至 35%,并把加权 WER 从 8.36% 降至 7.52%。
2026-08-06
研究
共享记忆是把双刃剑:将演员-评论家算法扩展到五个以上智能体时回报递减
研究人员在参数化动作任务中跨演员-评论家智能体共享回放缓冲区。GAC的性能大幅提升,但SAC和TQC仅有微小进步。超过五个智能体后,计算成本上升,却无实质性回报。该论文为共享经验方法的扩展极限提供了一个实用边界。
2026-07-27
人工智能与神经科学
语言模型被扰乱神经元后,精准复现了中风对语言的影响
研究人员扰动LLaVA 1.6以模拟失语症患者的图片命名错误,在79.5%的案例中,成功匹配了多达七个错误类别中的个体患者轮廓。在六种错误类别中,有六种自然地出现在不同的扰动配置下,这表明通用多模态模型可以充当中风后语言障碍的数字孪生。
2026-07-24
具身智能
小米发布380亿参数具身智能开源大模型,突破数据瓶颈
凭借一个统一四项机器人任务的380亿参数模型,并开源整个流程,小米旨在打破具身智能的数据瓶颈。早期基准测试显示,在使用模型增强数据训练时,任务完成率提升了26%。
2026-07-15
具身智能
阿里巴巴通义千问(Qwen)已嵌入15万台机器人、汽车、眼镜和无人机中
阿里巴巴通义千问(Qwen)AI家族现已驱动超过15万台硬件设备,从人形机器人到儿童相机,标志着公司从聊天机器人向具身智能(Physical AI)的战略转型,将多模态模型集成至机器人、汽车、眼镜和无人机中。
2026-07-14
AI研究
为何GPT-5.5在测试智能体自我改进能力的基准测试中占据主导
EvoPolicyGym 隔离了一个关键但研究不足的能力:智能体通过反复受限反馈编辑来完善可执行策略的能力。该基准测试显示 GPT-5.5 在 16 个环境中表现最强,并提供了轨迹级诊断,揭示了不同智能体如何分配预算以及如何将反馈转化为调优参数。
2026-07-11
内存管理
Bing速度背后的12000行秘密:mimalloc如何打破内存分配器的权衡困境
微软研究院的mimalloc分配器利用数千个按页划分的空闲列表以及一种巧妙的页窃取技术,同时实现了高并发和低内存开销,正如RiSE团队在一篇新的技术博客中详述的那样。
2026-07-10
NLP历史
改变语言模型对话方式的基准测试:2018年的GLUE如何永远改变了AI
2018年推出的GLUE基准测试通过提供语言理解的标准化标尺,改变了自然语言处理。它的遗产存在于每一个现代LLM基准测试中,从SuperGLUE到定义当今AI竞赛的最新竞技场式评估。
2026-07-08
机器学习研究
Fast-LeWM:并行动作前缀预测大幅降低潜在世界模型规划成本
研究人员介绍了Fast-LeWM,这是一种潜在世界模型,通过并行预测动作前缀对应的未来状态来加速视觉规划。该方法降低了计算成本和误差累积,性能优于以往的单步转移模型。
2026-07-07