SevenTnewS

人工智能安全

19 published articles

Anthropic / Claude3 min read

AI 安全与能力

Anthropic 发布 Claude Mythos 5:面向网络安全与生物学的双重用途模型

出口限制解除后,Anthropic 的 Claude Mythos 5 正在向选定的美国组织推出。该模型在网络安全和生物学基准测试中创下新高,但由于双重用途风险,其使用仍受到严格限制。

2026-07-09

人工智能Featured4 min read

AI哲学

不,AI并非竞争者,而是我们智力的延伸

借鉴胡塞尔的现象学,研究人员认为,AI系统最好被理解为自然智能的延伸,而非自主思维。这一视角解释了幻觉和组合错误,同时将安全辩论从对恶意AI的恐惧,转向负责任的工程与治理。

2026-07-09

人工智能Featured6 min read

AI安全

Anthropic 的越狱严重性量表:重塑AI安全监管的提议

Anthropic 提出了一套四轴评分系统,用于评估 AI 越狱的严重性,从“信息性”到“关键性”,并详细说明了阻止 Fable 5 被用于危险网络安全用途的分类器。该框架与 Glasswing 合作伙伴共同开发,旨在标准化行业和监管机构讨论模型滥用的方式。

2026-07-08

人工智能3 min read

AI监管

美国解除出口管制后,Claude Fable 5 回归。以下是Anthropic所做的改变

美国出口管制解除后,Anthropic重新部署了Claude Fable 5和Mythos 5。该公司概述了安全保障更新、提议的越狱严重性框架以及与政府就AI安全展开合作的新承诺。

2026-07-07

Anthropic / ClaudeFeatured3 min read

国际扩张

Anthropic 开设首尔办事处,扩大韩国 AI 生态系统合作

Anthropic 开设首尔办事处,并宣布与 NAVER、Nexon、LG CNS、韩华解决方案、三星 SDS 等公司合作。与韩国科学技术信息通信部签署的谅解备忘录聚焦于 AI 安全和网络安全。

2026-07-07

人工智能5 min read

人工智能

AI是人类智能的延伸,而非替代

现代AI系统之所以强大,并非因为它们复制了人类智能,而是因为它们延伸了人类认知和语言中已经存在的结构。这一视角有助于解释AI的能力及其反复出现的边界,包括幻觉和组合性缺口,并将AI安全的焦点从“失控AI”叙事转向系统级治理和人类责任。

2026-07-04

大语言模型与模型4 min read

AI安全研究

AI模型无法停止“边想边说”。这对安全性而言既是好消息,也是噩梦。

Claude Sonnet 4.5 仅有 2.7% 的时间能控制其思维链,而最终输出的可控性却高达 61.9%。这一差距引发了对思维链监控作为安全机制稳健性的开放性疑问,而无人知晓其存在的原因。

2026-03-09

← PreviousPage 2 / 2 · 19 articlesNext →