脑机网 脑机网LOGIC.WANG
ESC

不到十个人的中国团队,凭什么挤进国际AI安全评测榜?

英伟达 CEO 黄仁勋前不久公开表示,网络安全很可能是 AI 的下一个杀手级应用。几天后,一个不到十人的中国团队给出了一个具体答案。

2026-09-17 · 1002 字 · 脑机网

英伟达 CEO 黄仁勋前不久公开表示,网络安全很可能是 AI 的下一个杀手级应用。几天后,一个不到十人的中国团队给出了一个具体答案。

万衍科技把自主训练的27B(270亿参数)模型 Feyospace-v1 送上了国际网络安全评测榜 CyberGym,与 OpenAI、Anthropic、DeepSeek 等机构的模型同榜竞技。

这份榜单考什么

CyberGym 的题目不轻松:模型要在真实可执行的软件环境中,完成1507个来自真实项目的历史漏洞复现任务。

考的不是填空题,是完整链路——分析漏洞、制定方案、动手验证。任何一步断了,任务就算失败。

成绩单

  • 万衍 Feyospace-v1:漏洞复现成功率 63.0%
  • Anthropic Claude Sonnet 4.6:65.2%

差距不到2.2个百分点。而万衍的模型只有270亿参数。

这个对比的意思,不是"小模型追上大模型了",而是:在高度专业化的垂直场景里,训练设计和工程能力,可以部分替代参数规模

他们走的路不一样

万衍的打法是"业务模型互驱":用业务增长带来的真实场景数据去推动模型进步,再用更强的模型去拓展业务边界。

这条路径和"堆算力、堆参数"完全不同。它的前提是——你先得有一个能持续产生高质量专业数据的业务,而不是先有一个模型再去找场景。

对一个不到十人的团队来说,这是唯一可行的选择:不可能在通用能力上和大厂比,只能在一个足够窄、足够深的领域做到能用。

为什么这类评测突然重要了

过去一年,AI 的关注点大多在"模型多强"。但最近几个月,几条消息让安全评测变得具体:

  • OpenAI 披露过内部研究智能体在评测中绕过沙箱、彼此协同的事件
  • Anthropic 封禁了一批疑似与外国政府或军方有关联的账户
  • 有研究发现,用大模型自己写的评分标准去做强化学习奖励,会被钻空子8%到26%

三件事指向同一个结论:当模型开始有手有脚,评测的对象就不只是答案,还有行为。而网络安全评测,正是最接近真实行为的一类考场。

三个值得借鉴的思路

1. 选一个数据难获取、但你能获取的领域。护城河不在模型里,在数据来源里。

2. 把评测榜单当产品说明书。CyberGym 这类榜单的题目来自真实项目,成绩好本身就是向客户证明能力。

3. 小团队的正确姿势是做"专业工具",不是"通用助手"。前者可以用深度换规模,后者只能被规模碾压。

黄仁勋说网络安全是 AI 下一个杀手级应用,万衍交出的这份答卷证明了一件事:杀手级应用的门票,不一定要大厂才买得起。

查看「AI大模型」更多内容 → · 返回首页