SevenTnewS

Features

In-depth special reports combining feature, analysis, interview and profile reporting.

31 published features

4 min read

人工智能

为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题

麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。

2026-07-29

6 min read

智能体金融

你的投资组合黑箱即将打开:首个实时智能体金融追踪器内部解析

NextFund记录AI交易智能体在实时市场中做出的每一项决策,让用户比较模型、检查理由并诊断失败。一项针对美国、中国和香港股票的八款大语言模型测试显示,相似的中间信号可能分化为截然不同的投资组合行为,且季度排名会根据最关键的指标而翻转。

2026-07-27

Featured5 min read

网络防御

Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案

Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。

2026-07-21

7 min read

生物合理性AI

一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒

Sakana AI的“误差扩散”将类脑、无反向传播学习扩展到CIFAR-10和强化学习。关键在于:哪些设计选择更重要在不同的基准测试间逆转,而戴尔原理的成本随任务难度增加。

2026-07-19

5 min read

管控型代理研究

英伟达新型AI科学家无需接触患者数据即可工作

英伟达AI技术中心推出NAIS,这是一个受管控的代理研究系统,可在受保护的医院数据上协调端到端生物医学工作流。在一项涉及286,422人的真实世界高血压GWAS部署中,该系统产生了与专家主导分析相当的结果,同时保护了隐私并允许人类监督。

2026-07-19

Featured5 min read

本地AI

无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要

对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。

2026-07-19

6 min read

模型编排

Sakana AI 想帮你把选择大模型这件事变成别人的问题

Sakana AI 的 Fugu 将每个任务路由至一个单一 API 背后的专用模型,承诺减少集成开销并提升成本效益。它正进入一个快速成型的品类,在这个品类中,模型本身逐渐成为一个实现细节。

2026-07-18

Featured5 min read

特别报道 / 边缘AI

Nvidia DeepStream 开源:9.1版本对边缘AI意味着什么

Nvidia DeepStream视频分析SDK的完整源代码现已在GitHub上以Apache 2.0和CC-BY-4.0许可证发布,向更广泛的开发者开放了边缘AI开发。9.1版本引入了基于LLM的编码代理、Triton推理服务器集成以及用于端到端流程的整合仓库。

2026-07-16

5 min read

机器学习理论

为什么扩散模型能插值而非简单记忆:创造力的数学理论

谷歌研究人员揭示,扩散模型的创造力源于神经网络正则化引起的“分数平滑”效应。这一理论框架解释了为什么模型在训练数据点之间插值,而非仅仅记忆它们,为可控新颖性的生成式AI开辟了道路。

2026-07-16

5 min read

弃用档案

Mistral AI 大幅精简模型家族:哪些保留、为何保留?

对 Mistral AI 模型组合进行的 2026 年中年审计显示,在其前沿、专业和遗留层级共有 36 个活跃模型,其中 19 个模型计划在 2026 年中年之前弃用。该公司的策略侧重于面向智能体和编程的小型专业模型,同时弃用 Magistrate 和早期 Devstral 版本等实验性变体。

2026-07-13

Featured4 min read

特别报道

今年企业 AI 领域最平静的变化:赌代理在集群中工作效果更好

OpenAI 推出工作区代理:持久的、基于云的 AI 工作者,可在 ChatGPT 和 Slack 中运行,处理多步骤工作流程,并跨团队共享上下文。2026 年 5 月 6 日前免费,之后转为基于信用。从 GPT 到组织 AI 的结构性转变。

2026-07-11

Featured3 min read

Grok 4.5

Cursor的Grok 4.5由AI智能体而非人类构建, , 这才是真正的新闻。

Cursor的Grok 4.5是一个混合专家模型,使用由早期AI智能体(而非人类)创造的环境中的强化学习进行训练。它能处理软件工程、数据科学、金融和法律等领域复杂且耗时长久的任务,现已可用。

2026-07-10

← PreviousPage 2 / 3 · 31 featuresNext →