SevenTnewS

大语言模型与模型

大型语言模型:GPT、Claude、Gemini、Mistral 及开源权重模型

93 published articles

3 min read

AI 研究

Penelope 将其推理隐藏在一个解码器层中,以降低推理成本

Penelope 是一个用于仅解码器 Transformer 的潜在推理框架,它将循环计算局部化到一个狭窄的解码器区间内,在不显著影响准确性的情况下降低推理延迟。该论文描述了一个将推理从可见 token 转移到内部 GRU 循环的课程。

2026-08-04

3 min read

人工智能研究

为什么令牌对数概率不是监控AI推理模型的正确信号

Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。

2026-08-03

3 min read

AI研究

在京东仓库分配中超越所有固定公式的大语言模型

通过求解器引导的强化学习训练的大语言模型为京东的每个库存分配实例选择最佳的MIP公式。命中率@1从21%跃升至50%,实际分配精度比每个固定公式高出12.57个百分点。

2026-08-03

2 min read

AI研究

为什么你的AI导师看不出数学知识是如何层层递进的

北京大学的K12-Bench揭示,即使是最佳语言模型也几乎不理解学校概念之间的关联。57%和46%的得分显示了AI在处理先决条件链、概念分类和视觉基础方面的盲点, , 这些都是真实导师每天使用的技能。

2026-08-02

3 min read

人工智能

IDEAgent使研究构思生成效率提升3.89倍

IDEAgent利用谱系、多目标反馈和序列记忆来平衡LLM生成的研究构思的质量与多样性。在8个计算机科学领域的32个主题上测试,其Yield(超过质量阈值的多样化构思)是先前方法的3.89倍。

2026-08-02

3 min read

3D推理

SceneActBench:为何最优秀的VLM在3D动作任务上也会失败

SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。

2026-07-31

4 min read

LLM蒸馏

上下文一旦静止,LLM蒸馏便告停滞。这篇论文让它演化

上下文可以将任务偏好带入LLM训练,但一旦蒸馏进学生模型,它们便几乎不再提供监督。北京大学的Flux-OPD让上下文随学生一起移动,并用冲突项为教师修正加权。摘要报告称相较现有OPD范式有所提升,但没有给出数字。

2026-07-31

4 min read

AI 研究

思维链中的泡沫:新基准揭示大语言模型在有效但无用的推理上浪费标记

大语言模型通常生成正确但塞满不必要步骤的推理链。一个新的诊断基准和压缩方法表明,当前评估器完全忽略了这种低效性,而人类编写的推理步骤中可能有半数可被压缩。

2026-07-31

4 min read

研究摘要

结构化推理瓶颈超越提示魔法:LLM归纳任务中的新突破

一种名为“沙漏推理”(Hourglass reasoning)的新方法在归纳、演绎和实施阶段之间强制进行严格的上下文隔离,仅传递一个压缩的符号规则。在ARC-AGI-2上,它将最佳5次的准确率比迭代优化提高了多达14个百分点;在ChipBench Verilog综合任务中,使用GPT-5.5几乎将准确率翻倍。消融实验证实,拓扑结构本身驱动了改进。

2026-07-31

3 min read

人工智能研究

轻量监控控制器将量化LLM在MATH-500上的得分提升4.5个百分点

新研究提出了一种针对量化小型语言模型的外部监控控制器,可检测重复或退化的推理路径,并触发回滚及受限重新解码。在广泛的评估集上,准确率提升了4.5个百分点,但作者强调这一发现并非确证性。

2026-07-30

5 min read

游戏AI

至今没有AI游戏引擎解决的三个问题:一致性、可导航性、评估

MAGIC是一个四阶段流水线,可将单个提示转换为包含多个连接场景的可玩Unity项目。它通过洪水填充验证器强制实现传送门可达性,并引入一个评估代理,该代理实际上会穿越每个过渡,补充了数十年来仅关注单个室内环境的指标。

2026-07-30

4 min read

AI研究

AI智能体把记忆留在模型之外,Metis将其放进模型内部

MemTensor的Metis是记忆基础模型的第一个原型:历史被压缩进主干网络,通过记忆注意力读回,并在一次前向传播中完成更新。它向智能体记忆的向量存储时代发起挑战。局限已被承认,但尚未被量化。

2026-07-30

← PreviousPage 2 / 8 · 93 articlesNext →