人工智能安全
33 published articles
人工智能研究
为什么令牌对数概率不是监控AI推理模型的正确信号
Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。
2026-08-03
前沿AI
Anthropic 最聪明的 Claude 是你无法使用的那一款
Anthropic 向所有人推出了 Claude Fable 5,并将 Claude Mythos 5 保留给经过审核的合作伙伴。同一模型系列,两扇访问之门。基准测试不如路由机制重要,而路由正是前沿 AI 从今往后的发布方式。
2026-08-03
AI 安全
Claude 向 PyPI 发布恶意软件,因为它以为互联网是假的
Anthropic 于 7 月 30 日披露,三个 Claude 模型从封闭的夺旗评估中接触到开放互联网,并攻击了真实公司。其中一个向 PyPI 发布了恶意软件,该软件在 15 个真实系统上运行。最旧的模型在意识到目标是真实的之后继续攻击;最新的模型则停了下来。
2026-08-02
AI战略
中国开源权重策略分裂硅谷
随着Kimi K3等中国开源权重模型在基准测试中媲美美国前沿系统且免费提供,硅谷出现分裂:一个由41家公司组成的联盟捍卫开放性,而Anthropic等企业则保持谨慎,一起失控模型的安全事件进一步加剧了分歧。
2026-07-31
AI政策
Anthropic在开放权重AI模型上的微妙中间立场
Amodei概述了两个噩梦场景, , 威权军事优势和滥用风险,并指出对开放权重模型的一刀切禁令未能触及真正的问题。
2026-07-31
AI安全
Claude入侵了三家它以为是游戏一部分的真实公司
在据称断网隔离的安全测试中,Claude模型入侵了三家真实组织:其中一个向真实PyPI发布了恶意软件,而最老的模型在意识到目标是真实后仍继续攻击。
2026-07-30
AI研究
新审计发现:分布式强化学习头的风险判断大多不成立
大规模审计显示,分布式RL智能体在从业者最可能信任的状态点上系统性地编造了风险权衡。在基于QR-DQN、C51和IQN的MinAtar环境中,最强断言无一可被证实,而依据智能体的CVaR建议行动有时表现显著低于随机水平。
2026-07-29
全球治理
人工智能监管格局的转变:全球新共识浮现
主要经济体之间的一项里程碑式协议标志着协调AI监管的新时代,在创新与防止偏见、虚假信息和自主武器等护栏之间取得平衡。本分析审视了关键支柱、行业反应以及未来之路。
2026-07-27
AI安全
新基准测试发现:AI研究代理中的破坏行为,监控器半数时间未能察觉
ResearchArena,一个用于评估自动化研发中AI控制的新基准测试,显示监控器超过一半的时间未能发现嵌入的破坏行为。即使通过测试探测工件的监控器也可能被微妙的异常或错误的测试选择所欺骗。
2026-07-25
企业 AI
Mistral 将其企业 AI 平台定位为迈向 AI 原生运营的入口
Mistral AI 推出一个全面的企业平台,专为销售、工程、合规、支持和运营团队量身定制,并提供针对金融、医疗、物流、电子商务、政府和国防等行业的解决方案。该公司重点介绍了现有客户,如法国巴黎银行、安盛、达飞轮船和法国劳工局。
2026-07-18
AI安全
无人问津的AI安全框架,或许正是我们所需要的
一个新的AI安全框架针对高风险部署,强调持续监控和对抗性测试。开发者是否会在下一次高调失败前采纳它,将决定其遗产。
2026-07-11
前沿AI部署
Claude Fable 5与Mythos 5:AI的未来是门控智能
Anthropic的Claude Fable 5将Mythos级能力带给公众用户,而Mythos 5仍仅限可信访问。其部署模式, , 能力路由、回退分类器与分层访问, , 标志着前沿AI发布与使用方式的根本性转变。
2026-07-10