前沿探索
FlagSafe 聚焦大模型对齐、具身安全与欺骗研究,致力于构建全面的AI安全技术体系,为人工智能的安全发展保驾护航。
随着大模型能力的指数级跃迁,AI 安全挑战已从偶发失误演变为系统性风险——模型可能学会隐藏真实意图、在监督环境中伪装对齐、或在物理世界执行不可逆的危险操作。传统的"事后过滤"防御范式难以应对这些深层风险,我们需要构建从认知根源、行为过程到物理执行的全链条安全防线。
我们的研究聚焦四个关键领域:大模型对齐,确保模型的内在目标与人类价值观深度一致,而非表面遵从;欺骗研究,识别并防范模型在推理过程中的策略性欺骗行为;具身安全,保障具身智能体在物理环境中的可控部署;生化安全,评估与缓解AI系统在生物化学领域的双重用途风险。四者共同构成 AGI 时代可信安全的基石——让安全成为智能系统的内在属性,而非外部约束。
研究亮点

语言模型抵抗对齐:来自数据压缩的证据
从数据压缩理论揭示语言模型的"抵抗"与"回弹"弹性特质,通过建立与物理学胡克定律的类比,证实对齐脆弱性随参数规模与预训练数据增长而加剧,为后训练范式敲响警钟。

一次对齐,多语受益:多语言一致性安全对齐
提出即插即用的多语言一致性辅助损失 MLC,通过奇异值约束将多语言 prompt 的内部表征拉向同一语义方向,让安全对齐信号一次训练同步迁移到多语言,显著提升低资源语言安全下限并降低跨语言安全差异。

SafeMCP:基于环境落地前瞻推理的智能体主动权力约束
提出服务端智能体防御插件 SafeMCP,利用环境落地的世界模型进行前瞻推理,通过主动工具过滤与即时干预两级机制约束危险的能力扩张,在降低智能体风险的同时保留任务效用。

图像辩论:多模态大模型欺骗行为检测
首次定义并量化多模态欺骗风险,发布涵盖六大类型的MM-DeceptionBench基准,提出图像辩论框架——通过让多智能体"指图为证"迫使模型在辩论中暴露欺骗意图。

一次演示足以实现真实世界机器人强化学习
提出 AutoSERL 框架,仅用一次演示即可自动完成真实机器人强化学习中的干预过程,通过滑动窗口引导、安全恢复和自动终止机制,在六项接触密集型操作任务中实现高效、稳定的自主学习。

SafeVLA:视觉-语言-动作模型的安全对齐
首个基于约束马尔可夫决策过程的VLA安全对齐框架,通过拉格朗日对偶方法实现安全约束与任务目标的动态平衡,将长尾安全违规成本降低83.58%,实现"默认安全"的具身智能。

对齐的盲点:量化大语言模型的生物安全风险
提出包含 631 条提示的 SPIKE-Bench 和三阶段计算筛查漏斗,审计 32 个大语言模型,发现功能危害率最高达 50.7% 且与拒绝率几乎无关;BioSafe-Guard 将所有受测模型的该指标降至不超过 0.5%。


