人工智能安全
19 published articles
AI 安全与能力
Anthropic 发布 Claude Mythos 5:面向网络安全与生物学的双重用途模型
出口限制解除后,Anthropic 的 Claude Mythos 5 正在向选定的美国组织推出。该模型在网络安全和生物学基准测试中创下新高,但由于双重用途风险,其使用仍受到严格限制。
2026-07-09
AI哲学
不,AI并非竞争者,而是我们智力的延伸
借鉴胡塞尔的现象学,研究人员认为,AI系统最好被理解为自然智能的延伸,而非自主思维。这一视角解释了幻觉和组合错误,同时将安全辩论从对恶意AI的恐惧,转向负责任的工程与治理。
2026-07-09
AI安全
Anthropic 的越狱严重性量表:重塑AI安全监管的提议
Anthropic 提出了一套四轴评分系统,用于评估 AI 越狱的严重性,从“信息性”到“关键性”,并详细说明了阻止 Fable 5 被用于危险网络安全用途的分类器。该框架与 Glasswing 合作伙伴共同开发,旨在标准化行业和监管机构讨论模型滥用的方式。
2026-07-08
AI监管
美国解除出口管制后,Claude Fable 5 回归。以下是Anthropic所做的改变
美国出口管制解除后,Anthropic重新部署了Claude Fable 5和Mythos 5。该公司概述了安全保障更新、提议的越狱严重性框架以及与政府就AI安全展开合作的新承诺。
2026-07-07
国际扩张
Anthropic 开设首尔办事处,扩大韩国 AI 生态系统合作
Anthropic 开设首尔办事处,并宣布与 NAVER、Nexon、LG CNS、韩华解决方案、三星 SDS 等公司合作。与韩国科学技术信息通信部签署的谅解备忘录聚焦于 AI 安全和网络安全。
2026-07-07
人工智能
AI是人类智能的延伸,而非替代
现代AI系统之所以强大,并非因为它们复制了人类智能,而是因为它们延伸了人类认知和语言中已经存在的结构。这一视角有助于解释AI的能力及其反复出现的边界,包括幻觉和组合性缺口,并将AI安全的焦点从“失控AI”叙事转向系统级治理和人类责任。
2026-07-04
AI安全研究
AI模型无法停止“边想边说”。这对安全性而言既是好消息,也是噩梦。
Claude Sonnet 4.5 仅有 2.7% 的时间能控制其思维链,而最终输出的可控性却高达 61.9%。这一差距引发了对思维链监控作为安全机制稳健性的开放性疑问,而无人知晓其存在的原因。
2026-03-09