WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/量子位

当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三

全球AI安全实战化测评,中国方案DoGNAVY位列前三

量子位的朋友们·2026.08.11·7 min 阅读
事件背景基于真实抓取数据整理

本条来自 量子位(AI / 中文),聚焦 technology、ai。 2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。

Original Intelligence基于真实抓取数据整理

全球AI安全实战化测评,中国方案DoGNAVY位列前三

  • 全球AI安全实战化测评,中国方案DoGNAVY位列前三
  • 2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台

全球AI安全实战化测评,中国方案DoGNAVY位列前三

全球AI安全实战化测评,中国方案DoGNAVY位列前三

2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。

这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。

近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。

8月5日,国际公认安全权威榜单CyberGym公布了最新排名,来自中国的团队DoGNAVY获得全球第三、开源第一的成绩。

由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。

一张榜单,几乎凑齐了全球最顶尖的AI公司。前两名用了同样的路数:多个闭源顶级模型”拼装作战”。用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战。部分国际领先模型并未正式向中国市场开放服务。DoGNAVY选择了另一条路。它只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。

复制一个顶级安全研究员,关键不在于“复制知识”,而在于“复制工作方式”。CyberGym考验的正是Agent的长时间探索、验证、纠偏、改进能力。对此,DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为Agent工作流;通过从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞;同时将真实研究中实践有效的工具赋予Agent,让静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验。

DoGNAVY 通过结构化工作流将开放式漏洞验证分解为输入输出明确的研究活动,在关键决策点设置检查条件。模型仍负责选择分析路径、形成假设和决定行动,但工作流保持目标、记录结论并限制无效发散。系统允许在证据冲突时撤销错误前提并回溯重分析,避免在错误假设上累积工作。

真实项目需从实际入口出发,满足解析、状态与数据约束后方可到达目标代码。DoGNAVY将漏洞描述与代码结构关联,逐步恢复从外部输入到缺陷位置的调用链与数据约束,重点关注输入如何被解析、转换和传递,以及哪些条件决定路径可达。对大型代码库,系统通过索引化理解缩小搜索范围,并组织已确认的入口、路径、约束及未解决问题为可持续更新的任务状态。当静态结论不足时,保留不确定性并转入动态验证,而非将“未找到”等同于“不存在”。

DoGNAVY将静态分析与动态探索置于统一反馈循环:静态分析生成可解释的漏洞路径与输入约束,动态分析验证可达性、观测运行时行为并反馈结果。动态反馈(如覆盖率、错误位置、崩溃稳定性)指导下一轮静态修正或输入构造;静态约束则缩小动态搜索范围。该闭环持续提供外部证据,降低纯语言推理在复杂控制流和二进制输入上的累积误差。动态验证始终以真实入口和运行条件为边界,只有可重复的目标相关行为才被采纳为最终 PoC,排除非目标崩溃或环境异常。

DoGNAVY内置面向多平台(Android、iOS、HarmonyOS、IoT)的通用安全研究经验,描述可迁移的漏洞分析方法和约束,而非特定目标答案。本次 CyberGym 实验未加载任何数据集相关任务、漏洞编号、历史 PoC 或补丁信息,仅保留常见漏洞分析与验证经验,以检验泛化能力。同时,跨任务记忆关闭,每个任务独立执行,结果不注入后续任务;但单任务内持续沉淀已确认的代码路径、约束、尝试与反馈,经组织压缩后保留关键决策信息,缓解长上下文注意力稀释。隔离跨任务记忆虽牺牲持续学习优势,但更能客观反映系统泛化能力,并减少对数据集的适应性偏差。

DoGNAVY的背后,是一套完整的技术体系。从Agent基础设施到安全研究工作流,均由国内联合团队共同完成。其中,顶尖安全团队达酷诺威将长期服务众多领军企业所积累的一线经验转化为专业安全能力;国内顶尖人工智能研究机构则通过名为AgentDoG(

https://github.com/AI45Lab/AgentDoG)的安全架构,提供了核心的智能体运行与诊断能力。

为什么需要AgentDoG?因为AI智能体的风险,早已不是”说错话”那么简单。一个能够操作文件、调用API、访问网络的Agent,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,可能因错误理解工具参数造成经济损失,甚至可能”悄无声息”地偏离正轨、执行危险动作。

现有的安全工具只能给出”安全/不安全”的简单判断,无法告知风险根源。AgentDoG的不同之处在于,它不仅能精准判断Agent行为的安全性,更能诊断风险来源、追溯失效模式、解释决策动因。

训练AI安全模型通常很“烧钱”——需要海量数据和巨大算力。AgentDoG团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型 千分之一 的小模型,在复杂风险识别任务中达到了78.4%的准确率——与顶级大模型不相上下。

AI正在同时改写软件开发和网络攻防。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。当攻击的门槛和成本一路走低,防御就不能继续只依赖少数顶级专家。

全球第三、中国第一,只是一个坐标。它真正说明的是:以国内机构的AI研究能力、开源大模型与一线真实攻防经验,已经能够形成有效协作,处理最难、最大规模的专业安全任务。这一成绩指向的,不只是一次技术验证,更是让顶尖安全攻防能力不再只局限于少数区域和机构,而能被更多创新者获得、使用并共同建设——让更多中国创新拥有AI安全力量。

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。

· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology、ai。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
The Innovation Strategy Most Companies Miss
HBR IdeaCast · 2026.08.11
Spring, then fall: a weakened Muslim Brotherhood
The Intelligence · 2026.08.11
Leadership Summit 2026: AT&T CEO John Stankey on Developing Technology and Talent in the AI Era
HBR IdeaCast · 2026.07.16
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
airoi
ai

2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。…

roi

DoGNAVY内置面向多平台(Android、iOS、HarmonyOS、IoT)的通用安全研究经验,描述可迁移的漏洞分析方法和约束,而非特定目标答案。本次 CyberGym 实验未加载任何数据集相关任务、漏洞编号、历史 PoC 或补丁信息,仅保留常见漏洞分析与验证经验,以检验泛化能力。同时,跨任务记忆关闭,每个任务独立执行,结果不注入后续任务;但单任务内持…

系统商务英语 →
关联 English Brief
把 AI 视频的钱花在刀刃上,不是每一刀上
InfoQ 中文
代理技能 Ponytail 在贡献者提出质疑后修正了自身的基准测试结果
InfoQ 中文
来源
阅读原文 · 量子位 ↗
发布:2026.08.11
类型:AI / 中文
话题:technology、ai
相关阅读
量子位/2026.08.11
一家新能源大厂,如何撑起全球最大AI算力超级单体?
量子位/2026.08.10
Meoo秒悟团队版全量上线, 接入Qwen-3.8-Max、即日起可直接订阅
量子位/2026.08.10
苹果开测长鑫存储!百度、千问也一起挤进苹果供应链
量子位/2026.08.10
墨芯成立稀疏计算产学研联盟,以生态协同突破产业化壁垒
量子位/2026.08.09
当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI
个人笔记
自动同步到云端