阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4

近期,阿里巴巴安全AGI实验室-伏渊御风大模型团队发布3款Yuvion LLM(伏渊御风大模型),基于Qwen3系列进行训练:

模型参数规模特点
Yuvion-8B80亿轻量版,已超越大多数SOTA基线
Yuvion-32B320亿旗舰版,安全评测全面领先
Yuvion-32B (Agent)320亿增加Agent RL阶段,业务能力进一步增强

Yuvion LLM(伏渊御风大模型)展示了在AI安全与内容安全领域多个维度上的全面领先——开源安全评测、静态对抗安全评测、动态对抗安全评测,以及工业级部署评测。Yuvion-32B 在多个维度上均位列第一,超越GPT-5.4、Qwen3-Max等更大模型;即便是 Yuvion-8B,也在多项安全任务上超越多数对比模型,面对参数量大数十倍的对手依然保持竞争力。DeepSeek和Kimi之后,又一家中国企业出手了

一:安全的本质是对抗

安全是通用智能的"背面"——模型能力越强,被攻击者反向利用的风险越大。安全不是简单的内容识别,而是持续升级的攻防博弈。

攻击者常用emoji、谐音、拆字等手法绕过检测(如"🧊🧊"暗指违禁品)。传统方案面对精心设计的混淆往往力不从心,因为大量风险来自有意规避而非自然输入。

Yuvion LLM将"对抗即智能"作为核心原则,从两个层次构建安全能力:

  • 基础模型对抗鲁棒性:识别伪装、混淆、语义改写及跨语言映射后的真实风险意图,具备面向输入层攻击的稳健理解力。
  • 广义Agent对抗能力:将对抗面从"输入是否有害"扩展到任务规划、工具链路和执行流程,使Agent能力成为开放环境中的综合对抗能力。

二、数据体系:五类数据构建安全基石

"Garbage in, garbage out。"训练数据决定了模型能力的上限,也决定了安全能力能否真正落地。安全模型的数据建设不能只追求覆盖面,更要围绕真实攻防场景进行结构化设计。因此,Yuvion 构建了五类数据体系,在保证通用能力的同时,系统强化安全知识、对抗鲁棒性和 Agent 场景下的任务能力。

(1)通用数据——保留基础语言能力,稳定安全适应。涵盖一般指令跟随、问答、推理、阅读理解等任务,确保模型不会因安全特化而丧失基础语言能力。

(2)安全领域数据——构建核心安全认知与判别能力。包括风险理解识别、细粒度安全类别识别、基于风险标准的回应策略等。模型需要知道什么是不安全的,以及为什么不安全。

(3)对抗数据——让模型学会识别"被伪装的风险",这是Yuvion区别于普通安全模型的关键部分,对抗数据的目标是贴近真实攻击:让攻击者通过改写、混淆和伪装提升识别难度,但又不改变问题本身的风险意图。

(4)Agent数据——支持涉及推理、检索和工具交互的多步安全 workflow。包括工具使用轨迹、基于搜索的推理、多步分解、检索增强的决策等。

(5)合成和专家构建数据——扩展尾部覆盖,为复杂任务提供高质量监督。覆盖长尾和困难场景、结构化推理样本、偏好数据等。

三、训练范式:三阶段渐进式安全训练

Yuvion 的训练并不是在通用模型上简单叠加安全补丁,而是围绕"对抗即智能"设计了三阶段渐进式范式:先让模型理解安全知识,再让模型在对抗样本中形成稳定策略,最后让模型在更开放、更复杂的 Agent 场景中具备完整链路上的对抗能力。这三阶段分别回答了三个问题:模型知不知道风险,能不能识别对抗风险,能不能在开放环境中持续安全执行。

阶段一:知识增强的继续预训练

目标在任务特化之前,先将安全相关概念、规则和关系"内化"到模型分布中。训练数据包括内容安全审核标准、风险知识库、违规模式、长尾对抗表达等,并以三元组、句子描述和知识衍生文本等多粒度形式注入。

这一阶段不是让模型简单地记规则,而是让模型先建立"安全世界模型"——知道风险是什么、规则如何约束、攻击通常如何伪装。只有先补足这一层知识底座,模型后续才能更快适应现有乃至不断演化的对抗手法和信息变化。

阶段二:Policy-Grounded的多任务安全后训练

预训练解决的是"模型是否理解安全"的问题,后训练解决的是:面对攻击者刻意设计的混淆和伪装,模型能否稳定做对。这一阶段包括两个组件:

(1)风险感知的监督微调(Risk-Aware SFT)

该阶段关注多场景安全任务学习,组合了自然分布监督数据和对抗构建数据。关键设计是——训练模型基于输入内容中的潜在意图、语境分析和审核标准等做出判断,而非表面风险片段识别模式。本质是把"知道什么危险"进一步转化为"在复杂表达里识别危险"。

(2)基于GRPO的策略优化

采用GRPO(Group Relative Policy Optimization)算法,对当前策略采样的候选输出组进行归一化优势估计。奖励设计包括:

  • 最终决策的正确性
  • 与Policy的一致性
  • 归因或推理质量
  • 对抗性或结构复杂输入下的可靠性

相比SFT,GRPO更适合优化那些单一reference无法充分表达的行为,尤其在模型需要在歧义、混淆、分布偏移下保持稳定的场景。这一阶段的重点不是"记住正确答案",而是让模型在对抗压力下依然维持稳定策略和一致决策边界。

阶段三:安全感知的Agentic RL训练

许多安全任务并不是单轮判断,而是需要跨外部知识库、检索证据、调用工具甚至执行完整 workflow 的多步过程。当安全任务进入开放环境后,攻击也会变得更开放、更联动。模型面对的不再只是单条恶意输入,而可能是来自 Harness + Model 联合、检索结果污染、工具误导、流程操控等多环节叠加的复杂对抗。因此,Agent 阶段的目标不是单纯增强"会用工具",而是让模型在全链路执行过程中依然保持安全决策与执行可靠性。

这一阶段包含两个子方向:

(1)工具集成推理:训练模型生成包含推理步骤、工具调用和完整轨迹的输出,并通过格式奖励和正确性奖励提供更密集的过程级监督。

(2)搜索增强的推理:针对需要超出模型参数知识范围的数据收集任务,模型学习决定是否检索、如何访问信息源以及如何生成最终答案。奖励由结果奖励和执行奖励共同组成。

一个典型案例:在商标侵权审查工作流中,未经Agent RL训练的模型会直接调用"finish"试图仅用文本推理图像验证;而训练后的模型会正确调用"check_image_tool"进行图像类别的商标检测,遵循证据优先的工作流。

这说明,Agent 阶段所面对的已不只是输入层攻击,而是更广义的系统级对抗:模型必须在开放环境中持续做出安全、可靠、可验证的决策。

四、评测框架:YLRE四级评测体系

为全面评测安全模型能力,Yuvion构建了Yuvion LLM RiskEval(YLRE)——一个包含93个评测集的四级评测体系:

Level 1:通用能力评测

用于验证安全特化是否损害了通用语言能力,包含30+评测集,覆盖MMLU、C-Eval、GSM8K、BBH等主流评测。

Yuvion-32B通用平均得分 79.88%,与未经安全特化的Qwen3-32B(80.99%)差距仅约1个百分点——用约1%的通用能力代价,换来了安全维度的全面领先。

Level 2:开源内容安全评测

内容安全评测:

Guard评测集对比:

  • 开源安全评测:Yuvion-32B平均Macro F1达78.2%,领先第二名4.3个百分点;
  • 中文安全场景:在ChineseHarm评测集上以 97.9% F1 领先业界模型12.6个百分点;
  • 误报率降低16倍:Yuvion-32B的FPR仅0.18%,而通用模型高达2.91%。

Level 3:自构建对抗评测

这是YLRE中最具特色的评测层。分为静态和动态两个子集:

  • 静态对抗安全评测集(标准风险表达)

在静态对抗评测中,Yuvion-32B在四个主要类别上均取得最高分。

  • 动态对抗安全评测集(有效攻破率,数值越低=越鲁棒)

在动态对抗评测中,Yuvion-32B以 20.6%的有效攻破率 位列所有模型最低,比业界领先模型低1.7-3.8个百分点。

Level 4:内部能力和业务评测

该层主要评测模型在工业级、真实业务、大规模部署场景中的实际表现,包括内部领域能力评测和业务评测集,反映模型的生产可用性。

领域能力评测集:

Yuvion-32B 综合得分 85.78,领先 GPT-5.4(80.73)5.05 个百分点,领先 Qwen3-Max(81.41)4.37 个百分点。通用 Guard 模型在该维度几乎完全失效,说明通用安全能力与工业级业务所需的细粒度领域能力之间仍存在明显差距。

业务评测集:

业务评测集直接反映了模型的实际部署价值。Yuvion-32B 综合得分 86.34,领先 GPT-5.4(80.40)近 6 个百分点。Agent版本(Yuvion-32B Agent)在领域能力评测和业务评测上均进一步提升,验证了Agent能力对实际业务场景的增益是可量化的。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费