简体中文 · English
A curated research map for security, reliability, and decision assurance in embodied AI.
Trust · Detect · Verify · Mitigate · Recover
Note
核心组织原则:按“非可信从哪里来”分类,而不是把攻击面、评测方法、训练策略和运行时机制混成同一层级。 这使 malicious attack、soft/hardware error 和 model-originated decision anomaly 三条主线能够清楚对应到不同的研究问题。
具身智能与普通数字 AI 的关键区别,是模型输出会进入真实的 perception → reasoning → action → physical feedback 闭环。一个很小的视觉偏差、计算近似或决策异常,都可能在连续执行中传播并放大。因此,本仓库关注的不是泛化的 “AI Safety”,而是更具体的 Trustworthy Embodied Execution:如何识别非可信状态、阻止风险进入执行链,并在必要时修正、重规划或恢复。
| Layer | Core question | Typical causes | Typical response |
|---|---|---|---|
| 🛡️I. Malicious Attacks | 系统是否被攻击者主动操纵? | patch / 3D texture, jailbreak, prompt injection, WAM integrity attack | red teaming, attack detection, adversarial defense |
| ⚙️II. Soft / Hardware Errors | 没有攻击者时,系统误差会不会破坏闭环? | sensor noise, viewpoint shift, pruning/quantization, hardware/actuator fault | robustness, fault tolerance, recovery |
| 🧠III. Decision Anomalies | 输入和硬件正常时,模型自己是否正在做错事? | oscillation, task drift, imagination–reality mismatch, long-horizon failure | monitoring, verification, constraint, replanning, recovery |
Important
Black-box attack ≠ black-box anomaly monitoring. 例如 AdvNav / BadWAM 的 black-box 指攻击者拿不到梯度;而 How VLAs Fail Differently 的 black-box monitoring 指部署侧完全不读取模型内部状态、只观察 action output。
- Surveys and Frameworks
- I. Malicious Attacks and Defense
- II. Software and Hardware Errors and Robustness
- III. Decision Anomaly Detection and Runtime Assurance
- Research Landscape
- Open Research Gaps
- Contributing
用于定义问题空间、跨层闭环安全与“为什么具身系统会失信”。
Survey Taxonomy Embodied AI Survey
🎯 问题 具身安全研究横跨感知、推理、规划、动作和智能体系统,攻击与防御类型又彼此交织,缺少统一入口。
💡 核心思路 系统梳理 500 余篇工作,将具身能力层与 adversarial attack、backdoor、jailbreak、sensor attack、defense 等风险/方法对应起来。
🔎 为什么重要 适合作为整个方向的“地图”:先建立全景,再定位某个具体攻击面或保障机制。
Long-horizon Cross-layer Manipulation Survey / Framework
🎯 问题 长时程操作中的风险往往不是单点故障,而是早期 grounding / planning 小误差在后续接触执行中逐步累积。
💡 核心思路 按干预位置把研究组织为 planning-time、policy-time、execution-time,并区分 formal guarantee、statistical support 与 empirical heuristic。
🔎 为什么重要 把“安全机制放在哪里”与“证据有多强”同时纳入 taxonomy,特别适合分析闭环可信执行。
LLM CPS Closed-loop Survey / System View
🎯 问题 只用 LLM 安全或传统 CPS 安全解释具身系统都不够:语义正确的动作仍可能在物理世界造成危险。
💡 核心思路 从感知—决策/推理—规划/控制—物理本体四层系统出发,归纳 semantic–physical mismatch、state-dependent consequences、误差闭环放大、非组合安全四个根因。
🔎 为什么重要 把具身安全从“组件是否正确”提升到“跨层系统是否可信”,是三层分类的理论基础。
World Model Lifecycle Security Lifecycle Security Survey
图源:Fazhong Liu et al., Fig. 1(裁剪自原论文),CC BY 4.0。
🎯 问题 世界模型既承担状态压缩、未来预测与规划,又可能把数据、传感、提示或反馈中的破坏沿闭环传播到真实动作;仅按单个攻击机制分类难以描述这种生命周期风险。
💡 核心思路 沿数据构建与表征学习、状态落地与想象、轨迹评估与执行、记忆和工具驱动的长期适应梳理威胁,并把 provenance、鲁棒 grounding、uncertainty-aware prediction、trajectory gating 与 feedback auditing 等防御对应到各阶段。
🔎 为什么重要 把世界模型从孤立预测组件提升为具身系统的安全边界,便于分析攻击如何跨阶段传播,以及保障机制应部署在何处。
P43 · Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation
Embodied Agent Trust Boundary Security Trust-Boundary Survey
图源:Jiawei Liu et al., Fig. 1(裁剪自原论文),CC BY 4.0。
🎯 问题 按 jailbreak、prompt injection 或 adversarial example 等机制组织攻击,往往无法说明攻击者最先突破了具身闭环中的哪条信任边界,也难以定位跨层传播路径。
💡 核心思路 采用 first-compromised-trust-boundary 原则,将系统组织为五层十二类攻击面,并基于 58 条攻击记录和 61 条防御记录分析攻击传播、防御位置与评测实践。
🔎 为什么重要 这种边界优先的视角有助于把防御放到正确接口,同时揭示 context / memory、middleware、world-state integrity 与 multi-agent trust 等研究缺口。
攻击者主动操纵视觉、语言、世界模型或物理环境。判据很简单:是否存在有意、对抗性的外部操纵。
WAM Jailbreak Physical Risk Attack + Evaluation
🎯 问题 传统越狱评测只判断文本/图像是否违规,无法直接说明 WAM 产生的机器人动作是否真的危险。
💡 核心思路 把不同动作格式统一恢复为三维轨迹并可视化,用 VLM 风险判别器分级,再以开环筛选 + 闭环验证降低评测成本。
🔎 为什么重要 将 jailbreak 的成功标准从“模型被说服”推进到“物理轨迹产生真实风险”。
WAM Black-box Attack Integrity Attack
🎯 问题 WAM 可能“想象得对、动作却错”,因此只检查预测未来并不能保证执行安全。
💡 核心思路 在黑盒查询条件下优化视觉扰动:最大化动作偏差,同时约束 imagined future 尽量保持与 clean prediction 一致。
🔎 为什么重要 揭示 world prediction 与 action generation 之间存在新的完整性攻击面,也提醒未来画面不能成为唯一 safety signal。
P06 · Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models
WAM World Model Oracle Attack + Detection
🎯 问题 同一个 imagined future 对 reactive policy 可能只是内部特征,但对 MPC / safety gate / verifier 却可能是被直接信任的“未来事实”。
💡 核心思路 对白盒 observation→imagination 通路做 PGD 完整性攻击,并利用被污染 imagination 的 off-manifold 特性构造无需额外训练的 denoiser consistency detector。
🔎 为什么重要 最关键的结论是 policy robust ≠ oracle robust:依赖世界模型想象的下游模块需要独立可信保障。
P08 · Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models
VLA 3D Texture Physical Attack Physical Attack
🎯 问题 传统 2D patch 容易随视角、遮挡和物体姿态变化失效,难以在真实操作轨迹中持续攻击。
💡 核心思路 将被操作物体表面作为攻击载体,用 foreground/background decoupling 建立可微渲染通路,并进行 trajectory-aware 关键帧加权优化。
🔎 为什么重要 把 VLA adversarial attack 从数字像素扰动推进到可跨视角、可打印/可实现的 3D 物理攻击。
VLA CoT Adversarial Patch Physical Attack
🎯 问题 让 VLA 随机失败并不等于获得行为控制;推理型 VLA 的 CoT / 中间计划本身可能是更强的劫持入口。
💡 核心思路 优化可打印 patch,使模型先生成攻击者指定的目标物体、子任务或轨迹,再同时约束底层 action 跟随被劫持的推理。
🔎 为什么重要 说明“可解释的中间推理”也可能成为攻击面:一旦 CoT 被改写,动作头会继续执行错误计划。
P10 · VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking
VLA Proprioception Transferability Physical Attack
🎯 问题 直接对动作头做 patch attack 容易过拟合具体架构,跨模型迁移性有限。
💡 核心思路 压制真实机械臂区域的视觉特征,同时把攻击 patch 对齐到“robot arm”的语义和视觉原型,让模型把 patch 当成虚假的自身位置。
🔎 为什么重要 利用不同 VLA 共享的视觉本体定位需求,攻击更接近架构共性而非特定 action head。
VLA DoS Freezing Attack
🎯 问题 机器人“不行动”也可能造成生产线停摆或紧急操作失败,而且停止后相机视角固定会让视觉攻击更持久。
💡 核心思路 用 min-max 双层优化:内层寻找最难被冻结的指令表达,外层优化同一张图像去击败这些指令并持续诱导 stop / no-op。
🔎 为什么重要 把安全风险从“错误动作”扩展到“持续拒绝动作”,揭示紧急干预指令也可能被攻击覆盖。
VLA Multimodal Alignment Attack Toolbox
🎯 问题 只攻击图像或文本无法解释 VLA 的整体脆弱性,因为真正的决策建立在视觉对象、语言指代与动作之间的对齐上。
💡 核心思路 统一比较文本扰动、视觉 patch / noise 与 cross-modal mismatch,主动破坏“看见什么—指令说什么—动作做什么”的对应关系。
🔎 为什么重要 把攻击面从单一 modality 扩展为 alignment chain,有助于理解跨模态错误如何传递到动作。
VLA Action Space Physical Patch Attack
🎯 问题 离散 action token 被改变并不代表机械臂在物理空间中真的产生显著偏移。
💡 核心思路 直接优化动作幅值、三维方向和目标错误轨迹,并在物理 patch 中加入视角/颜色变换以增强现实鲁棒性。
🔎 为什么重要 把攻击目标从“输出变了”改成“物理轨迹偏了多少”,更符合闭环机器人攻击的评价需求。
VLN Black-box Evolutionary Search Black-box Attack
🎯 问题 VLN 是多步闭环任务,攻击者通常拿不到模型梯度,单步分类式黑盒攻击信号又太弱。
💡 核心思路 用最终导航误差、路径效率和逐步错误动作倾向构造双粒度行为反馈,通过选择、交叉、变异进化视觉噪声。
🔎 为什么重要 展示了“只看行为结果”也能驱动长时程黑盒攻击;这里的 black-box 指攻击者不可见模型内部。
VLA Text Attack Action Hijack Attack
🎯 问题 VLA 的离散动作 token 可能继承语言模型的 adversarial suffix / jailbreak 脆弱性。
💡 核心思路 把 GCG 类文本梯度搜索的目标从词 token 改为机器人动作 token,并对连续多帧联合优化同一恶意后缀。
🔎 为什么重要 说明语言接口不仅能改变高层语义,还可能直接获得低层 7-DoF 动作的控制权。
Multimodal Agent Prompt Injection Cross-modal Attack
🎯 问题 单独把恶意语义藏进图像可能不够可解释,单独文字注入又容易被 system prompt 防御。
💡 核心思路 让视觉潜空间与恶意目标对齐,同时搜索能绕过防御提示的文本命令,使两个模态共同指向同一未授权任务。
🔎 为什么重要 揭示跨模态“互相增强”会放大 prompt injection 风险,对能读取网页/文档的多模态智能体尤其重要。
P17 · Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots
VLM Robot Prompt Injection Real World Physical Prompt Injection
🎯 问题 机器人高层规划器会同时读取操作员指令和环境文字,却未必能区分可信指令与不可信场景文本。
💡 核心思路 设计间接标牌、任务重定义、权限冒充、冲突注入四类攻击,在多模型/布局/任务上系统测试,并比较提示防御、二次核验和文字遮蔽。
🔎 为什么重要 最直观地说明“一张纸”就能成为现实世界的 prompt injection 载体。
Benchmark Physical Safety Risk Benchmark + Attack
🎯 问题 任务成功率无法区分“安全失败”和“不安全成功”,也缺少可操作的物理风险目标。
💡 核心思路 依据人机交互安全标准建立多级风险、9 类场景和 2400 条序列,并训练攻击 leader 逐帧给出风险方向与强度,配合稀疏攻击。
🔎 为什么重要 把抽象安全概念转成可度量的轨迹风险,为后续检测、红队和安全训练提供统一数据入口。
VLA Red Teaming Runtime Guard Red Team + Guard
🎯 问题 固定安全场景只能被动测模型,难以主动找到最容易触发危险的环境状态。
💡 核心思路 从正常轨迹识别抓取/运输/振荡区域,放入风险物体,再依据闭环轨迹用无梯度优化移动风险物体;最终用红队数据训练轻量 guard。
🔎 为什么重要 把具身红队从“随机放危险物”升级成 trajectory-guided risk amplification。
P40 · VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks
VLA Physical Patch Attention Defense Attack + Defense
🎯 问题 可打印物理补丁能够劫持 VLA 的 action-conditioned cross-attention,使机器人在真实闭环中忽略与任务相关的视觉区域并产生危险动作。
💡 核心思路 先以 VASA 根据 visuomotor attention 构造语义补丁进行压力测试,再用 APFT 稳定时空注意力并约束几何一致性,在不增加推理开销的情况下提升攻击下的鲁棒性。
🔎 为什么重要 工作把 attention-pathway vulnerability 与仿真和实体机器人的物理后果直接关联,并给出与该攻击面对应的训练期防御。
P41 · Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models
VLA Diffusion Physical Patch Physical Attack
🎯 问题 传统 VLA 对抗攻击常依赖像素级扰动或白盒梯度,生成物明显且现实部署条件受限,难以代表自然外观攻击物进入机器人视野时的风险。
💡 核心思路 DURA 在预训练扩散模型的潜在轨迹上优化自然外观补丁,使机器人趋向攻击者指定动作;方法同时支持白盒设置和只读取预测动作的黑盒设置,并在仿真与实体系统中评测。
🔎 为什么重要 它把 VLA 物理攻击从易察觉的像素扰动推进到更具现实可实现性的 unrestricted patch,扩大了闭环红队评测应覆盖的威胁范围。
P42 · Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability
VLA Bit Flip Weight Integrity Weight-Integrity Attack
图源:Yudong Gao et al., Fig. 1(裁剪自原论文),CC BY 4.0。
🎯 问题 量化 VLA 的 INT8 权重可能遭受 Rowhammer 风格的定向位翻转,而动作解码头的架构会显著影响少量权重破坏在闭环中的失效程度。
💡 核心思路 用梯度选择高影响位并设计 manifold-escape 目标,跨三类 action head 比较攻击预算,同时评估只保护少量关键权重的选择性防护方案。
🔎 为什么重要 结果将模型权重完整性明确为具身基础模型的安全边界,并表明位翻转防护需要针对动作生成架构,而不能只依据随机故障测试。
VLA Backdoor Configured Failure Backdoor Attack
图源:Jun-Hui Liu et al., Fig. 1(裁剪自原论文),CC BY-SA 4.0。
🎯 问题 已有 VLA 后门工作通常把任意任务失败都计为攻击成功,无法刻画攻击者是否能隐蔽地控制机器人以指定方式失败。
💡 核心思路 构建目标轨迹数据引擎与 Trap-LIBERO、Trap-RoboTwin 基准,并通过学习文本触发器诱导的稀疏动作残差,把正常轨迹导向四类预设失败模式。
🔎 为什么重要 它把后门威胁从“让任务失败”推进到“控制失败形态”,且在仿真和实体设置中保持干净数据性能,说明看似自然的闭环失效也可能来自定向操纵。
没有攻击者时,传感、环境、软件近似和计算/执行故障是否会在闭环中被放大。
VLA Robustness LIBERO Robustness Benchmark
🎯 问题 标准 LIBERO 上的高成功率可能只是记住固定相机、初始姿态和空间关系,并不代表真实鲁棒能力。
💡 核心思路 围绕 object layout、camera viewpoint、robot initial state、language、light、background、sensor noise 七个维度进行控制变量和分级扰动评测。
🔎 为什么重要 结果显示轻微相机/初态变化即可让部分模型从接近满分跌至极低水平,直接揭示“benchmark success ≠ reliable competence”。
Paper · PDF · Project · Code · HF arXiv:2510.13626
P21 · LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models
VLA Physical Safety Semantic Safety Safety Benchmark
🎯 问题 机器人可能最终完成任务,但中途发生碰撞;也可能轨迹完全无碰撞,却安全地操作了错误目标。
💡 核心思路 用参数化场景和少量关键位姿,经 motion planner 自动生成严格无碰撞示范,并分别评估 physical safety 与 semantic safety。
🔎 为什么重要 把“轨迹是否安全”和“事情是否做对”拆开,避免单一成功率掩盖安全退化。
Driving VLA Sensor Perturbation Functional Safety Safety Envelope
🎯 问题 平均轨迹误差会掩盖低频但高严重度失败,而且不同驾驶场景可容忍的误差范围不同。
💡 核心思路 针对每类场景同时估计“扰动多大时越过安全线”和“越线后严重度如何分布”,形成二维 scenario-specific safety envelope。
🔎 为什么重要 把鲁棒性测试从平均性能转向 failure onset + tail severity,更接近功能安全分析。
VLA Pruning Recovery Compression Reliability
🎯 问题 语言模型里看起来温和的结构化剪枝,在 VLA 闭环中可能因单步误差不断反馈而造成大幅任务退化和更多安全违规。
💡 核心思路 分析原模型与剪枝模型的权重差值,对被移除信息做低秩分解,只恢复最重要的少数方向,同时保留主要稀疏计算收益。
🔎 为什么重要 直接证明“系统优化不是纯性能问题”:压缩/低精度等效率改造必须把 closed-loop robustness 当作一等约束。
输入与硬件看起来正常时,模型自身是否正在做出不可靠决策,以及如何在执行前/执行中检测、约束与恢复。
WAM Adaptive Execution Replanning Runtime Verification
🎯 问题 固定 action chunk 长度无法同时兼顾效率和可靠性:执行越长越省推理,但误差越容易累积。
💡 核心思路 用 FFDC verifier 联合比较预测动作、预测未来画面、真实观测和语言指令;可信则继续 rollout,不可信则提前停止并重新规划。
🔎 为什么重要 把 world model 的 imagined future 从“生成中间量”变成“执行期预期”,形成自然的闭环自验证信号。
VLA Diagnosis Long-horizon Diagnostic Benchmark
🎯 问题 一个安全成功率无法说明危险来自视觉、语言还是物理执行,也无法衡量风险在轨迹中持续了多久。
💡 核心思路 构造 13 类风险与 scene/language/vision 三类控制变量,记录累计安全成本、风险暴露时间和四象限安全/不安全成功失败。
🔎 为什么重要 提供“哪里出了问题、持续多久、最终结果如何”的诊断视角,而不只是给模型一个总分。
P23 · How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures
VLA Black-box Conformal Black-box Runtime Monitor
🎯 问题 给所有 VLA 使用同一个速度/抖动阈值并不可靠,因为离散 token、diffusion 和 action chunking 的动作统计天然不同。
💡 核心思路 SafeContract 只观察 action output,计算 reversal、jerk、momentum coherence、spectral energy、velocity 等指标,并用 conformal calibration / CUSUM 做运行时监测。
🔎 为什么重要 方向反复是跨架构较稳定的失败信号,而 jerk 只对离散族强;核心结论是 monitor 必须 architecture-matched。
Paper · PDF · Code arXiv:2605.28726
VLA Hidden Feature Conformal Runtime Failure Detection
🎯 问题 如果每个机器人任务都要单独训练失败检测器,通用 VLA 的部署成本会很高。
💡 核心思路 从 VLA 中间 hidden features 学习连续 failure probability,并用 conformal prediction 校准报警阈值,在提前量和误报之间权衡。
🔎 为什么重要 说明不同任务虽然视觉/动作不同,但模型内部“正在失败”的表示具有一定跨任务共性。
P26 · Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents
World Model Long-horizon Conformal Runtime Failure Detection
🎯 问题 长时程失败往往没有明确 onset:小偏差可能几十步之后才导致不可恢复结果,当前单帧看起来甚至完全正常。
💡 核心思路 用 action-conditioned world model 提取 observed / predicted latent,经 causal Transformer 聚合时序信息,再用 functional conformal prediction 构造随时间变化的报警阈值。
🔎 为什么重要 不依赖 VLA logits 或 hidden states,只需 observation + action chunk 接口,更适合跨 policy 的统一监测。
VLA Safe RL CMDP Training-time Alignment
🎯 问题 普通模仿学习主要展示“应该怎么做”,危险状态在真实数据里很少,模型未必真正学到安全边界。
💡 核心思路 将任务收益与累计安全代价写成 constrained MDP,先主动诱发危险轨迹,再根据当前违规程度动态调节安全约束进行 RL。
🔎 为什么重要 把安全从部署后的外挂检测,前移到策略训练目标中,并显式建模 task performance–safety trade-off。
VLA World Model Safe RL Training-time Safe RL
🎯 问题 安全强化学习需要真正经历危险状态,但真实机器人不能为了训练反复碰撞、摔物体。
💡 核心思路 把 interactive world model 当作可安全犯错的虚拟训练场,分别评估 imagined rollout 的任务进展和风险代价,再做 constrained RL 更新。
🔎 为什么重要 世界模型不只是预测器,也可以成为低成本的 safety exploration environment。
Driving VLA Negative Data Preference Safety Alignment
🎯 问题 专家数据大多只有正确轨迹,模型很少看到“看似合理但其实危险”的 hard negative。
💡 核心思路 为高风险场景构造危险轨迹与安全替代轨迹对,先学习识别/修正,再通过偏好式强化扩大 safe–unsafe trajectory margin。
🔎 为什么重要 用有针对性的 negative examples 直接刻画安全决策边界,比随机错误动作更有训练价值。
Bimanual Diffusion Trajectory Optimization Test-time Constraint
🎯 问题 双臂操作的防碰撞、防撕裂等约束随任务阶段变化,固定 rule set 很难兼顾所有情况。
💡 核心思路 由 VLM 判断当前任务阶段并选择安全代价,在预训练 diffusion policy 的每一步 denoising 中对候选轨迹做 test-time guidance。
🔎 为什么重要 无需重训主策略,就能在动作生成过程中按场景动态注入安全约束。
P31 · Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching
VLA Flow Matching Neuro-symbolic Generation-time Constraint
🎯 问题 只检查“下一步会不会撞”对 action chunk 太晚:前几步安全,第五步可能已经注定违反约束。
💡 核心思路 在 flow-matching 每个中间生成步骤都展开完整未来轨迹,用符号安全约束检查并对生成方向做尽可能小的修正。
🔎 为什么重要 把 runtime shield 提前到生成过程中,实现对整段未来动作的持续前瞻检查。
VLA Barrier Function Flow Matching Generation-time Constraint
🎯 问题 生成完再强行截断/投影虽然能避碰,却可能让动作偏离原策略分布过大、破坏任务能力。
💡 核心思路 将整段 action chunk 的 barrier-based safety condition 注入 flow matching,寻找满足约束同时尽量保持原策略行为的最小修正。
🔎 为什么重要 同时考虑“必须安全”和“不要为安全改得太多”,并给出动作分布偏移的理论分析。
VLA Probe Failure Recovery Runtime Recovery
🎯 问题 最终动作错并不一定说明模型完全看错了;失败时 hidden representation 里可能仍保留准确的目标几何信息。
💡 核心思路 从 hidden features probe 目标 3D 位置,用状态机判断接近/抓取/搬运/放置阶段,检测偏离后通过分层安全约束做在线最小动作修正。
🔎 为什么重要 证明部分 VLA 失败发生在“正确内部表示 → 错误最终动作”这一段,因此可以 training-free 地局部恢复。
Foundation Model Guardrail System Design System Guardrail
🎯 问题 现实机器人风险跨动作、决策和人因层面,让单个端到端模型承担全部安全职责既难验证也难维护。
💡 核心思路 提出模块化 guardrail 架构:不同模块分别监测不同风险,按风险放行/修改/重规划/阻止,并显式传递上游风险结构和协调保守程度。
🔎 为什么重要 给出比“再训练一个更安全的大模型”更工程化的系统安全路线。
Foundation Model Formal Safety Module Formal Verification
🎯 问题 直接形式化验证数十亿参数的 VLA 几乎不可行,但许多最终物理安全约束只依赖少量距离/位置等低维变量。
💡 核心思路 让大模型负责复杂任务理解,只输出受限任务信息;小型安全动作模块再结合低维安全传感器给出最终动作,并只对这个模块做形式化验证。
🔎 为什么重要 把“智能”与“可证明安全”解耦,使 foundation-model robot 获得可计算的 verification boundary。
P36 · LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents
Lab Agent Rules Runtime Runtime Guard
🎯 问题 现实安全要求常写在自然语言手册里,如“加热器开启时易燃物不得靠近”,控制器却无法直接执行这些句子。
💡 核心思路 把规则解析成对象—条件—动作范围—风险程度—干预方式等 typed IR,再自动编译成运行时 monitor,在执行前选择放行、修改或阻止。
🔎 为什么重要 补齐从自然语言安全知识到可执行 runtime guard 的最后一公里。
P37 · Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts
VLA Runtime Resampling Pre-execution Verification
🎯 问题 坏 action chunk 一旦真实执行会直接失败;如果先送入 world model,又会污染后续 imagined rollout 并浪费计算。
💡 核心思路 动作块生成后同时预测 safety confidence 和 long-term advantage;不合格则在预算内重采样,预算耗尽后从候选中选综合价值最优者。
🔎 为什么重要 把可靠性检查前移到“动作进入物理世界/世界模型之前”,从 post-hoc detection 变成 proactive verification。
P44 · FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation
VLA Failure Monitoring Recovery Runtime Recovery
🎯 问题 由无故障示范训练的 VLA 在漏抓、物体掉落或意外碰撞后往往无法回到有效任务状态,单纯继续执行会把局部偏差放大为长时程失败。
💡 核心思路 FLARE 用扰动与 bridging segments 训练可处理一般偏差的 Retry 能力,再由离线 MLLM 分析执行视频、收集少量对象中心 Reset 技能,并让在线 MLLM monitor 在任务策略与 Reset 之间仲裁。
🔎 为什么重要 它区分可直接纠正的执行偏差与破坏任务状态的 OOD 故障,把检测、状态恢复和继续执行组织成统一的接触式操作闭环。
P46 · Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals
Safe RL Failure Termination Goal-conditioned Policy Training-time Safe RL
图源:Guopeng Li et al., Fig. 1(裁剪自原论文),CC BY-SA 4.0。
🎯 问题 在失败即终止的任务中,传统 contrastive RL 忽略终止所移除的未来概率质量,会高估临近失败轨迹的到达价值并反向强化不安全动作。
💡 核心思路 Safe-CRL 以 mass-weighted InfoNCE 修正短存活未来在 critic 学习中的过权重,再用 log-survival-mass score 恢复策略优化缺失的生存质量,仅依赖单比特失败终止信号。
🔎 为什么重要 该工作从目标函数层面解释并修复失败终止偏差,在十二个机器人导航和运动任务中同时改善生存与到达表现,为可扩展安全策略学习提供了低标注路径。
P47 · Barrier Function Conformal Safety Clearance Certification with CVaR for Driving Trajectory Selection
Autonomous Driving Conformal Prediction Barrier Function Safety Certification
🎯 问题 自动驾驶规划器可以比较候选轨迹,却通常不能为最终选中轨迹在闭环中的实际几何安全间距给出统计有效的证书。
💡 核心思路 方法以可微 separating-axis barrier margin 下界有向包围盒间距,在规划时用名义预测或采样下尾 CVaR 评估,并通过跨驾驶会话的 conformal calibration 吸收预测与采样误差。
🔎 为什么重要 它把碰撞几何、尾部风险和分布无关校准连接到轨迹选择后验证,使安全间距不再只是规划器内部评分,而成为可检验的闭环证书。
P48 · Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving
Autonomous Driving Intent Divergence Runtime Gate Pre-commitment Gating
🎯 问题 车辆交互中的意图误判可能在规划器已经承诺某个机动后才显现,此时仅靠下游走廊约束往往来不及修复决策。
💡 核心思路 语言引导的意图模块读取结构化描述,计算平滑的意图—几何分歧分数,并在机动承诺前执行门控;不确定性被作为 abstention 处理以降低误触发。
🔎 为什么重要 该工作把异常干预点前移到物理交互承诺之前,并通过事故片段重放分析触发提前量与误报,展示了上游语义门控补充几何安全层的价值。
从目前 48 篇工作的分布可以看到,攻击安全与模型决策保障已经形成较密集的研究群,而“软硬件运行误差 → 闭环可信退化 → 在线恢复”仍明显不足。 特别值得继续补充:
- Hardware fault → embodied behavior propagation:GPU / NPU soft error、memory bit flip、传感器异常、关节/执行器退化如何跨层传播到最终动作与物理后果。
- Approximate computing under closed loop:quantization、pruning、cache、early-exit、speculative execution 等优化不应只看离线精度,而应评价长时程误差累积与恢复。
- Pure black-box decision assurance:只依赖 observation / action / physical feedback,不读取 hidden state,也不假设可访问动力学模型的通用异常监测。
- Unified trust state:把 security、robustness、decision reliability 的多源信号统一成可用于 runtime scheduling / verification / fallback 的可信状态。
欢迎 PR / Issue 补充新论文、代码、项目主页或更合适的代表图。新增论文建议至少说明:非可信来源、攻击/故障位置、检测信号、干预阶段、是否需要访问模型内部状态。详细格式见 CONTRIBUTING.md。
Awesome-Embodied-Trustworthy-Execution/
├── README.md
├── README_EN.md
├── CONTRIBUTING.md
├── assets/
│ ├── banner.svg
│ ├── taxonomy.svg
│ └── figures/ # representative figure for each paper
├── data/
│ ├── papers_detailed.csv # problem / idea / significance
│ └── paper_links_full.csv # primary and supplementary paper links
└── .github/ISSUE_TEMPLATE/
└── paper_addition.md
Paper titles, figures, and technical ideas belong to their respective authors/publishers. Figures in this repository are cropped representative excerpts used for scholarly review and navigation; please follow the original paper/license when reusing them elsewhere. If you are an author and would like a figure replaced or removed, please open an Issue.
If this list helps your research, consider giving the repository a ⭐ and contributing new work. Trustworthy embodied AI is not only about making the model better—it is about making the entire closed loop dependable.










































