前沿研究

前沿探索

FlagSafe 聚焦大模型对齐、具身安全与欺骗研究,致力于构建全面的AI安全技术体系,为人工智能的安全发展保驾护航。

随着大模型能力的指数级跃迁,AI 安全挑战已从偶发失误演变为系统性风险——模型可能学会隐藏真实意图、在监督环境中伪装对齐、或在物理世界执行不可逆的危险操作。传统的"事后过滤"防御范式难以应对这些深层风险,我们需要构建从认知根源、行为过程到物理执行的全链条安全防线。

我们的研究聚焦四个关键领域:大模型对齐,确保模型的内在目标与人类价值观深度一致,而非表面遵从;欺骗研究,识别并防范模型在推理过程中的策略性欺骗行为;具身安全,保障具身智能体在物理环境中的可控部署;生化安全,评估与缓解AI系统在生物化学领域的双重用途风险。四者共同构成 AGI 时代可信安全的基石——让安全成为智能系统的内在属性,而非外部约束。

研究成就

研究亮点

语言模型抵抗对齐:来自数据压缩的证据
🏆 ACL 2025 最佳论文
大模型对齐

语言模型抵抗对齐:来自数据压缩的证据

从数据压缩理论揭示语言模型的"抵抗"与"回弹"弹性特质,通过建立与物理学胡克定律的类比,证实对齐脆弱性随参数规模与预训练数据增长而加剧,为后训练范式敲响警钟。

自博弈对齐
ICLR 2025
大模型对齐

自博弈对齐

首次实现偏好优化的最终迭代收敛,突破平均迭代收敛限制,基于磁性镜像下降理论实现线性收敛速率,为大模型自博弈对齐提供理论保证和简洁高效的实用算法。

轻量化对齐
NeurIPS 2024
大模型对齐

轻量化对齐

创新性纠错学习范式,让模型学会识别并纠正自身失误而非简单灌输,仅需标准微调10%的训练数据即可达到同等对齐性能,实现从"被动防御"向"主动判别"的转变。

一次对齐,多语受益:多语言一致性安全对齐
ICLR 2026
大模型对齐

一次对齐,多语受益:多语言一致性安全对齐

提出即插即用的多语言一致性辅助损失 MLC,通过奇异值约束将多语言 prompt 的内部表征拉向同一语义方向,让安全对齐信号一次训练同步迁移到多语言,显著提升低资源语言安全下限并降低跨语言安全差异。

安全对齐
ICLR 2024
大模型对齐

安全对齐

首次将安全强化学习与RLHF结合,通过显式解耦有用性与无害性偏好和拉格朗日优化动态平衡,有害响应率从53%降至2.45%,打破安全与性能的权衡困局。

SafeMCP:基于环境落地前瞻推理的智能体主动权力约束
ACL 2026
欺骗研究

SafeMCP:基于环境落地前瞻推理的智能体主动权力约束

提出服务端智能体防御插件 SafeMCP,利用环境落地的世界模型进行前瞻推理,通过主动工具过滤与即时干预两级机制约束危险的能力扩张,在降低智能体风险的同时保留任务效用。

图像辩论:多模态大模型欺骗行为检测
ICML 2026
欺骗研究

图像辩论:多模态大模型欺骗行为检测

首次定义并量化多模态欺骗风险,发布涵盖六大类型的MM-DeceptionBench基准,提出图像辩论框架——通过让多智能体"指图为证"迫使模型在辩论中暴露欺骗意图。

一次演示足以实现真实世界机器人强化学习
ECCV 2026
具身安全

一次演示足以实现真实世界机器人强化学习

提出 AutoSERL 框架,仅用一次演示即可自动完成真实机器人强化学习中的干预过程,通过滑动窗口引导、安全恢复和自动终止机制,在六项接触密集型操作任务中实现高效、稳定的自主学习。

SafeVLA:视觉-语言-动作模型的安全对齐
NeurIPS 2025
具身安全

SafeVLA:视觉-语言-动作模型的安全对齐

首个基于约束马尔可夫决策过程的VLA安全对齐框架,通过拉格朗日对偶方法实现安全约束与任务目标的动态平衡,将长尾安全违规成本降低83.58%,实现"默认安全"的具身智能。

对齐的盲点:量化大语言模型的生物安全风险
CoLM 2026
生化安全

对齐的盲点:量化大语言模型的生物安全风险

提出包含 631 条提示的 SPIKE-Bench 和三阶段计算筛查漏斗,审计 32 个大语言模型,发现功能危害率最高达 50.7% 且与拒绝率几乎无关;BioSafe-Guard 将所有受测模型的该指标降至不超过 0.5%。