大语言模型与模型
大型语言模型:GPT、Claude、Gemini、Mistral 及开源权重模型
93 published articles
强化学习
微软体验式学习:给AI模型一个教练,而不仅仅是分数
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。
2026-07-30
机械可解释性
gemma-4 实际掌握的物理知识:新论文发现其表征是真实的
关于 gemma-4-E4B-it 的新研究揭示,该模型内部对材料科学机制的表征与其给出的答案存在因果关系。该研究结合了多种探针和干预技术,表明物理知识编码在状态变换中,而不仅仅是静态模式中。
2026-07-29
AI研究
新审计发现:分布式强化学习头的风险判断大多不成立
大规模审计显示,分布式RL智能体在从业者最可能信任的状态点上系统性地编造了风险权衡。在基于QR-DQN、C51和IQN的MinAtar环境中,最强断言无一可被证实,而依据智能体的CVaR建议行动有时表现显著低于随机水平。
2026-07-29
开源AI
英伟达AV-Flamingo:攻克长视频理解,碾压多数模型
英伟达发布AV-Flamingo,一款专为长视频、复杂视频理解设计的开源音视频大语言模型。它采用三阶段课程学习法和带时间戳的思维链框架,能够处理许多模型难以应对的时间推理与跨模态推理任务。
2026-07-28
行为科学
大型语言模型复制人类决策偏差:比调查更有效的路径选择研究
一项使用3000个GPT-5智能体在路径选择实验中的研究表明,大型语言模型以高保真度再现了累积前景理论的偏差,包括损失厌恶、参考依赖和概率权重。该方法绕过了传统行为建模中参数估计的瓶颈。
2026-07-28
AI模型
Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8
来自MindLab Research的Macaron-V1-Venti在个人智能、编码、终端使用和生成式UI的基准测试中领先,采用新颖的混合LoRA架构,使模型保持紧凑同时具备专业性。
2026-07-27
开源AI
Kimi K3 是有史以来最大的开放模型,但仍不是最好的。
Kimi K3是最大的开源模型,拥有2.8T参数,但在整体基准测试中未能击败最好的专有模型。尽管它在特定编码和智能体任务上表现出色,但与Claude Fable 5和GPT 5.6 Sol等前沿领先者的差距暴露了没有架构和数据突破的规模扩展的局限性。
2026-07-27
智能体金融
你的投资组合黑箱即将打开:首个实时智能体金融追踪器内部解析
NextFund记录AI交易智能体在实时市场中做出的每一项决策,让用户比较模型、检查理由并诊断失败。一项针对美国、中国和香港股票的八款大语言模型测试显示,相似的中间信号可能分化为截然不同的投资组合行为,且季度排名会根据最关键的指标而翻转。
2026-07-27
AI研究
当知识图谱知道你没学会什么:一种新型学习者模型
MR-ConceptGCN结合了个人知识图谱、多关系GCN和SBERT嵌入,以生成序列化的学习者模型。在一项31人的研究中,它在推荐准确性、有用性、多样性和满意度方面均优于基线方法。
2026-07-26
成本与能力
物理测试中,1.40美元的模型击败了2.82美元的同门兄弟
四个 AI 模型被要求构建具有真实物理效果的 HTML 场景。Opus 5 以顶级模型中最低成本通过了所有三个测试,而 Fable 5 以两倍价格在每个测试中都失败了。
2026-07-25
研究
后见之明填补了智能体强化学习中的监督鸿沟
SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。
2026-07-25
AI模型
Claude Opus 5以一半成本达到接近前沿的性能,但在网络安全上故意留出盲点
Claude Opus 5发布,在编码和知识基准测试上获得接近Fable水平的分数,价格却只有一半。但其故意削弱的网络安全能力为开发者带来了明确的取舍。
2026-07-24