AutoVLA论文阅读笔记
论文https://arxiv.org/pdf/2506.13757代码1、为什么要做这个研究理论走向和目前缺陷 ?之前的vla模型要么结构复杂要么梯度断连自回归式的输出路点虽然优雅但是llm天然不太适合这种精确数值计算实际的输出轨迹不可行。2、他们怎么做这个研究 方法尤其是与之前不同之处 ?把连续轨迹通过k-disk离散为一个个动作token就可以用llm decode同时输出语言token和动作token。SFT阶段监督有两类只有动作监督和同时兼有动作和思考监督赋予模型快思考和慢思考的能力。RFT阶段用GRPO微调模型奖励函数同时考虑思维链长度和轨迹好坏使得模型能够自适应决定快思考和慢思考。3、发现了什么总结结果补充和理论的关系?效果不错模型结构优雅但是耗时严重且吃显存。摘要借助llm的世界知识和推理能力可以提升端到端自动驾驶表现效果。但是现有的vla模型经常会有这几个问题1输出的轨迹物理上是不可执行2模型结构过滤复杂3简单场景却进行长思考。本文提出的AutoVLA把思考和动作生成统一到自回归式输出的端到端模型中输入是视觉输入和文本引导输出就直接是思考过程和规划结果。通过把连续的轨迹离散为一个个的动作token这样就可以整合到语言token中了。训练时通过sft赋予了模型两种思考模式1快思考及不用显式输出思考内容直接输出规划token。2慢思考显式输出思维链内容和规划的token。为了提高规划的效率还用了grpo做强化学习后训练避免模型在简单场景中输出长思考内容。在nuPlan, nuScenes, Waymo, and CARLA的开环和闭环结果表明其性能不错。1 引言视觉为主的端到端VA模型对训练和部署要求不高研究已经非常多了但是VA模型主要还是用模仿学习的方法训练不具备世界知识长尾场景处理不好。vla模型利用了vlm的世界知识和推理能力理论上限更高。现有的vla模型有如下两个问题1用vlm模型以文本的方式直接出waypoints, 但是vlm模型天生对数值任务处理不好生成的轨迹实际是不可通行的。或者先出个元动作然后下游再用一个规划器/解码器细化为规划路径这样就结构复杂了而且可能会打断端到端优化的链路。2过度思考或过少思考。简单场景应该直接出动作就行了复杂场景需要深度思考但现有的模型没办法平衡。DriveVLM虽然通过快慢系统的方式实现了快执行和慢思考的平衡但是模型结构不够优化训练成本也比较大。AutoVLA通过把连续的轨迹离散为一个个的动作token这样就可以像语言token一样混在一起输出了。在SFT阶段模型既收到有思维链监督的真值数据也有只有规划路径的数据这样就赋予了模型快思考和慢思考的能力。同时在RFT阶段还设计了可变的规划奖励函数利用GRPO优化赋予模型自适应的决定思考的深度从而平衡路径规划的准确率和效率。本文主要贡献1提出AutoVLA模型利用了预训练vlm的端到端的模型可以直接进行策略学习和深度思考输入是原始图像和语言文本。2提出利用GRPO进行后训练赋予模型自适应快思考还是慢思考的能力。3开环和闭环评估性能都优秀。2 相关研究VA: UniAD, VAD, ParaDrive, GenAD, DiffusionDriveVLA/VLM大概三个方向1把驾驶视为一个问答任务不输出动作只做场景描述。2第二种就是用vlm或vla生成元动作或决策指令 交给下游的传统规划器或生成式规划器或端到端模型来细化为规划轨迹这种方法整合比较容易但是会打断端到端的优化。3第三种方案是把vlm直接出隐式动作token或最终的规划轨迹即vla然而仅仅用一个简单的轨迹解码器如mlp或GRU可能会产生实际并不可通行的规划路径ORION通过引入生成式规划器来解决此问题但增加了模型复杂度和计算量。强化学习微调RFT:RFT可以提升模型的性能和适用性。Gen-Drvie和TrajHF用了RFT来确保生成的轨迹安全且符合人类偏好。RAD用了3DGS来生成场景和RL闭环训练。但其实把RFT用于智驾VLA模型的训练还是比较少的AlphaDrive虽然用GRPO了增强规划性能并确保训练效率和稳定性但是仅仅作用于元动作层。本文GRPO后训练赋予模型自适应决定思考的深度的能力。3 AutoVLA模型主要有两个组件1VLM主干网络输入是图像和文本自回归输出是思考和动作token。2物理元动作生成把之前只生成语言token的llm decode拓展到去生成物理元动作这些元动作是物理上可以执行的通过聚类获得的保证可以被翻译成规划轨迹。训练AutoVLA主要有两个阶段1SFT阶段标注为GT轨迹思考内容。2RFT: 通过任务特定的奖励函数优化规划器性能从而提高运行效率并最小化不必要的推理。3.1 框架模型输入多帧多视角图像C 导航指令I 自车状态S, 具体来说用了自车的左前、前、右前三个相机作为输入每路相机用最近两秒的4帧输入即1个当前帧3个历史帧导航指令即左转、直行这种自车状态S包括速度、加速度和历史行为。基础的VLM模型qwen2.5-vl-3B动作分词器不连续的自车轨迹离散为物理元动作每个元动作就是短期的位移和方位角变化D_x, D_y, D_theta这样就可以把轨迹规划任务转化为next-token预测的任务构建动作码本是通过k-disk聚类算法实现的k-disk聚类相对k-means聚类获取动作码本更合适原因是k-disk使用最小包围圆盘圆心替代 K-Means 的均值向量作为簇代表可以避免生成物理不自然的中间轨迹。比如一簇点大部分集中在直行区域少量点在急转弯k-means均值会落在直行与转弯中间生成不真实的漂移动作。而k-disk MED 最小包围圆的圆心在直行簇中心圆刚好包住转弯离群点,用这个圆心做码本模板代表基础直行行为离群仅体现为圆盘半径增大不污染模板本身。最终获得了2048个元动作的动作码本。统一思考和动作用一个人llm decode既输出语言token,也输出动作token. 并自适应决定是否输出语言token。3.2 思维链数据思考的目的主要是理解复杂场景的语义以及动态环境的交互关系。虽然很重要但是想要获取大规模高质量的驾驶场景思维链数据比较困难主要原因是1驾驶场景大多比较简单和重复2对于关键信息如交通灯、车灯的表达不充分3思考过程质量低比如遇到stop sign就停。利用qwen2.5-vl-72b模型制备思维链数据并且保证4项关节内容详细的场景描述关键目标的识别交通参与者的意图自车驾驶的决策。为了规范思考效果还把最终的gt轨迹作为引导来生成思维链数据。有了上述思维链数据制备过程最终获得45.6k的nuPlan数据和7.2k的waymo数据。还整合了nuScenes和CARLA的DriveLM和VQA数据。3.3 SFT除了像标注llm训练是对所有输出token进行监督还额外对动作token进行监督。SFT数据中有些简单场景是没有思维链内容只有动作监督的所以上述公式就有可能对仅有动作的样本进行更大权重的监督了故此对动作token的损失计算单独计算权重并且如果有思维链内容也要整体赋予一个新的权重。3.4 RFTRFT确保自适应决定是否进行深度思考。用了GRPO微调可以稳定训练提升收敛速度。此外同一场景下进行多模态规划天然就比较适合GRPO优化。给定场景输入query q 包含图像自车状态导航指令从旧的策略中采样G个候选输出通过归一化组相对优化A获得当前策略模型目标函数大概逻辑就是计算每个输出的优势然后clip到一定范围内然后考虑每个输出的优势 更新当前策略模型同时利用新策略模型的相对SFT出来的模型一直不变的kl散度控制更新幅度。每个输出的优势利用一个奖励函数计算同时考虑驾驶奖励(nuPlan使用PDMS考虑安全舒适效率等。waymo用ADE)和思维链的奖励。思维链的奖励考虑了思维链的长度作为奖励函数。4 实验4.1 实验设置数据集真实场景和仿真数据都有。真实场景nuPlan 120小时驾驶数据8路摄像头。Waymo 111.7小时8路摄像头。nuScenes: 1000段城市场景数据6个摄像头。CARLA 50w帧数据6路摄像头。此外还用上了针对nuScenes和CARLA数据制作的思维链数据DriveLM.Benchmarks: 开环评估NAVISIMPDMS指标nuScenes 使用L2距离作为评估指标Waymo使用RFS评估指标。闭环评估Bench2Drive,指标SR, DR等。实现细节每个动作token对应0.5秒的运动预测未来5秒的动作变化即输出10个token。SFT阶段训5个epoch学习率0.00001FSDP训练策略。8卡L40s每张卡bs1累计四个step后梯度回传更新相当于bs32。SFT损失设置lamda_a 1, lamda_cot 40说明在有思维链的数据中损失权重更大。RFT阶段LoRA微调微调6000steps。4.2 主要结果数据规模实验nuPlan和nuScenes的实验均表明在数据规模效果比较小的时候只有动作监督放到效果更好当数据规模够大大于100k时有cot监督的数据效果更好。RFT性能慢思考模式很耗时如下表所示。故此用了RFT来增强模型自适应思考的能力实验表明RFT是的PDMS指标提升性能也有大幅提升耗时降低66.8%GRPO的group size越大越好。nuPlan 实验结果best-of-N是指输出的6条规划轨迹使用oracle打分器选出的最优的那个。Waymo E2E PerformanceCARLA闭环性能Bench2Drive benchmark4.3 消融实验文本式路点输出对比动作token和文本化的路点动作分词方法RT-1, FAST以及K-disk。RT-1方法对车辆动力学模型比较敏感而很多数据是只有轨迹的FAST需要比较大的码本效果才比较好。综合来看k-disk分词效果最好。5 结论统一思考和动作在同一个llm decoder中输出SFT使模型同时支持快思考和慢思考RFT使模型自适应决定是快思考还是慢思考。局限模型跑的tai慢1hz且显存消耗巨大。

相关新闻

基于大模型的智能留学咨询系统设计与优化

基于大模型的智能留学咨询系统设计与优化

1. 项目概述:留学咨询大模型的智能办理系统这个项目本质上是一个基于大语言模型的智能留学咨询系统,核心目标是通过AI技术实现留学申请流程的自动化处理。不同于传统留学中介的人工服务模式,我们采用大模型作为底层引擎,结合业务规…

2026/7/22 5:25:48 阅读更多 →
项目开发必备:如何系统管理前置条件(Prerequisites)

项目开发必备:如何系统管理前置条件(Prerequisites)

1. 项目概述"0.Prerequisites"这个标题看似简单,却蕴含着项目开发中最容易被忽视的关键环节。作为从业十余年的老手,我见过太多项目因为前期准备不足而中途夭折的案例。这个编号为0的阶段,实际上决定了整个项目的成败基础。在技术领…

2026/7/22 5:25:48 阅读更多 →
使用Visual C++为Authorware 7开发DLL:从原理到部署的完整指南

使用Visual C++为Authorware 7开发DLL:从原理到部署的完整指南

1. 项目概述与核心价值如果你是一位还在维护或开发Authorware 7项目的多媒体工程师,那么你大概率会遇到一个经典困境:Authorware自带的脚本功能(比如它的计算图标)在处理复杂逻辑、高性能计算或者与特定硬件(如串口、U…

2026/7/22 5:24:47 阅读更多 →

最新新闻

中古木纹置物架✨拯救我的极简治愈系浴室

中古木纹置物架✨拯救我的极简治愈系浴室

装修奶油风、原木中古风的姐妹都知道!浴室五金是氛围感的终极分水岭😭 费尽心思选的柔光瓷砖、复古花砖、极简卫浴,结果装一个冷冰冰的银色不锈钢置物架,瞬间毁掉全屋温柔质感,廉价感直接拉满! 更头疼的是小…

2026/7/22 6:04:03 阅读更多 →
蛋白组学测序一个多少钱-伯远生物

蛋白组学测序一个多少钱-伯远生物

蛋白组学测序一个多少钱-伯远生物 伯远生物是国家级专精特新小巨人企业,国家级重点实验室,牵头多项省部级重大专项,公司科研技术人员500(硕博占比40%以上),作为功能基因研究综合性平台, 15年技术…

2026/7/22 6:04:03 阅读更多 →
Docker多容器通信:解决Nginx连接PHP-FPM的502错误

Docker多容器通信:解决Nginx连接PHP-FPM的502错误

1. 问题背景与现象描述最近在本地开发环境搭建一个基于Docker的Web应用时,遇到了一个典型问题:Nginx和PHP分别运行在两个独立的容器中,但Nginx始终无法正确连接到PHP-FPM服务。具体表现为访问.php文件时返回502 Bad Gateway错误,或…

2026/7/22 6:04:03 阅读更多 →
梦回大唐演出电子入园票情况科普 西安古都艺票通供应电子演出门票

梦回大唐演出电子入园票情况科普 西安古都艺票通供应电子演出门票

导语在旅游出行中,观看一场精彩的演出能为旅程增添别样的色彩。对于前往西安旅游的游客来说,《梦回大唐》演出不容错过。而西安古都艺票通能为大家提供这场演出的电子门票。电子入园票以其便捷性逐渐受到游客青睐,下面就为大家详细科普《梦回…

2026/7/22 6:04:03 阅读更多 →
【深度】给 Agent 装的 Skill 越多越好?论文说恰恰相反——少而精才是王道

【深度】给 Agent 装的 Skill 越多越好?论文说恰恰相反——少而精才是王道

摘要:很多人给 Agent 装 Skill 的策略是"多多益善"——看到好用的就装,几周下来挂了几十个,以为越多越强。但最近一篇研究论文用实验数据给出了完全相反的结论:2-3 个精炼的 Skill 能提升 18.6% 的表现,一旦…

2026/7/22 6:04:03 阅读更多 →
LSTM架构选择指南:多层、双向与多层双向LSTM对比与实践

LSTM架构选择指南:多层、双向与多层双向LSTM对比与实践

在自然语言处理项目中,选择合适的LSTM结构往往直接影响模型性能。单层LSTM处理简单序列任务尚可,但面对复杂语言模式时,多层、双向以及多层双向LSTM能显著提升特征提取能力。本文将完整解析这三种结构的核心差异、适用场景及实现方案&#xf…

2026/7/22 6:03:03 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻