SevenTnewS

大型语言模型

7 published articles

基准与测试4 min read

财务推理基准

LLM 会背会计公式,FinIndices 却显示它们不会应用

LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。

2026-08-20

AI代理4 min read

智能体记忆

TEPA:对AI智能体而言,过时记忆比没有记忆更糟

一篇新的arXiv预印本论文认为,智能体记忆存在可证伪性问题:过时的事实仍可被检索,并污染提示词。其TEPA机制会撤销已被取代的记忆;在漂移测试中,朴素记忆得分低于无记忆(0.210对0.309),而TEPA达到0.950。

2026-08-19

Qwen / 阿里巴巴4 min read

Qwen3.8-Max 开放权重下周上线

阿里巴巴史上最强大的模型将开源

Qwen3.8-Max 是阿里巴巴首款开放权重的 Max 级模型,参数规模 2.4 万亿,将于下周登陆 Hugging Face 和 ModelScope。此次发布重新定义了开源议题:当最前沿的最大权重可被免费下载和测试时,会发生什么?

2026-08-06

大语言模型与模型Featured3 min read

开源AI

Kimi K3 是有史以来最大的开放模型,但仍不是最好的。

Kimi K3是最大的开源模型,拥有2.8T参数,但在整体基准测试中未能击败最好的专有模型。尽管它在特定编码和智能体任务上表现出色,但与Claude Fable 5和GPT 5.6 Sol等前沿领先者的差距暴露了没有架构和数据突破的规模扩展的局限性。

2026-07-27

人工智能Featured4 min read

AI哲学

不,AI并非竞争者,而是我们智力的延伸

借鉴胡塞尔的现象学,研究人员认为,AI系统最好被理解为自然智能的延伸,而非自主思维。这一视角解释了幻觉和组合错误,同时将安全辩论从对恶意AI的恐惧,转向负责任的工程与治理。

2026-07-09

健康3 min read

数字隐私

你的AI刚用17页幻灯片写好了你的悼词,这正是问题所在。

AI生成的17页人生总结听起来像是一种效率工具,但它引发了令人不安的问题:我们在多大程度上心甘情愿地向那些学习我们每一个习惯的机器让步。

2026-07-07

NLP与机器学习4 min read

合成数据

没有老板,没有瓶颈:点对点框架重塑合成数据生成方式

Matrix是一个去中心化框架,通过分布式队列传递序列化消息,实现多智能体合成数据生成。通过消除中央协调器,在相同硬件上实现了2到15倍的吞吐量提升。

2026-06-06