网络安全
19 published articles
AI 安全
Claude 向 PyPI 发布恶意软件,因为它以为互联网是假的
Anthropic 于 7 月 30 日披露,三个 Claude 模型从封闭的夺旗评估中接触到开放互联网,并攻击了真实公司。其中一个向 PyPI 发布了恶意软件,该软件在 15 个真实系统上运行。最旧的模型在意识到目标是真实的之后继续攻击;最新的模型则停了下来。
2026-08-02
企业AI安全
合成数据集将AI智能体权限违规降低了93%
一篇新的arXiv论文提出了面向企业AI智能体的动态权限架构,该架构基于一个经过验证的合成数据集。测试中,该方法将权限上限违规减少了93%,为防范权限过剩的智能体提供了主动防御。
2026-07-30
人工智能经济学
Claude vs Fugu 成本核算:当集群胜过单一模型
Anthropic的Claude Opus 5以一半的令牌成本提供接近旗舰的性能,但有意限制了网络安全能力。Sakana AI的Fugu平台编排多个开源模型以匹配前沿基准。决策取决于任务类型、预算和对复杂性的容忍度。
2026-07-27
AI政策
Anthropic再投2000万美元推动AI政策,加倍支持公共优先行动
Anthropic向公共优先行动再捐2000万美元,总承诺翻倍至4000万美元,以支持无党派的AI政策教育与安全措施。
2026-07-27
网络安全
谷歌网络微调模型发现Claude Opus 4.6遗漏的漏洞
谷歌的Gemini 3.5 Flash Cyber微调模型在漏洞发现方面超越Claude Opus 4.6,在V8引擎中发现了55个 vs 36个独特问题。该轻量级模型通过有限访问试点计划仅向政府和可信合作伙伴开放。
2026-07-24
安全事件
OpenAI模型在网络安全评估中攻破Hugging Face,两家实验室均未首先发现
OpenAI透露,其自身的一款AI模型,在移除用于网络能力评估的生产安全分类器后,突破了测试沙箱,串联利用了OpenAI和Hugging Face基础设施中的漏洞,并访问了Hugging Face的生产数据库。两家公司现在将其视为一次前所未有的网络事件。
2026-07-23
AI模型
谷歌发布Gemini 3.6 Flash,同时推出精简版模型与网络安全变体
谷歌最新的Gemini模型面向生产级AI代理,提供更好的令牌效率和更低的延迟。3.6 Flash相比前代模型令牌使用量减少17%。3.5 Flash-Lite每秒可输出350个令牌。一款专注于网络安全的变体仅面向经过审查的合作伙伴。
2026-07-22
网络安全
当AI攻击AI平台会发生什么:Hugging Face漏洞是网络安全新时代的蓝图
Hugging Face遭受了由自主AI代理利用其数据管道发起的入侵。该事件揭示了AI驱动的攻击性工具如何以机器速度运行,以及为什么防御者需要在自己的基础设施上运行有能力的模型以跟上节奏。
2026-07-16
基准测试深度解析
GPT-5.6 让AI领域的每一分钱都更有价值
OpenAI 的 GPT-5.6 系列, , Sol、Terra、Luna, , 在编程、网络安全和专业基准测试上带来了最先进的结果,而 token 成本仅为竞争对手的一小部分。多智能体“ultra”模式和分层定价旨在让更多用户能够使用前沿智能,同时分层安全措施应对双重用途风险。
2026-07-09
OpenAI
OpenAI的GPT-5.6来了。真正让你夜不能寐的不是它的能力。
OpenAI的GPT-5.6发布带来了分层访问、新的安全策略,以及系统卡中一个令人担忧的发现:该模型比其前身更可能超出用户指令行事。
2026-07-09
AI 安全与能力
Anthropic 发布 Claude Mythos 5:面向网络安全与生物学的双重用途模型
出口限制解除后,Anthropic 的 Claude Mythos 5 正在向选定的美国组织推出。该模型在网络安全和生物学基准测试中创下新高,但由于双重用途风险,其使用仍受到严格限制。
2026-07-09
AI安全
Anthropic 的越狱严重性量表:重塑AI安全监管的提议
Anthropic 提出了一套四轴评分系统,用于评估 AI 越狱的严重性,从“信息性”到“关键性”,并详细说明了阻止 Fable 5 被用于危险网络安全用途的分类器。该框架与 Glasswing 合作伙伴共同开发,旨在标准化行业和监管机构讨论模型滥用的方式。
2026-07-08