pi0.7阅读
本论文提出了一种能够利用多样化数据源的方法1.引言线索笔记栏研究动机想让 VLA 既可以像 LLM 组合式去调用原子技能执行长程任务LLM如果让它以鲁迅的语气元素 A写一篇关于量子力学元素 B的科普文章并且最后输出 JSON 格式元素 C。虽然它的训练数据集中没有同时满足这三个条件的文章但是它的训练数据中单独包含过这三个元素LLM 可以将这三个元素组合起来输出要求的文章。之前的 VLA1. 学过把苹果放到红碗里 2. 学过把香蕉放到绿碗里 。但是 prompt 让它把苹果放到绿碗里它不会把抓苹果和“放绿碗”这两个技能组合。只能重新采集把苹果放到绿碗里的数据集重新训练核心解决方法利用大规模且多样化的数据集1. 多种机器人及其不同策略的数据 2.自主执行过程中收集的次优数据成功或失败3.人类执行任务的视频 4. 互联网多模态数据但是简单多模态训练会导致模型学到对不同模式形式进行平均什么都没有学好怎么解决为数据添加详细的上下文标注语言标签、策略元数据、以及子任务图像等多模态数据1. 做什么 2. 如何做每个回合 VLA 学到动作技能和细微的概念机器人领域上下文文本描述不够的除了详细的文本提示pi0.7 还在提示中添加多种额外的元数据1. 策略元数据给每个数据集片段打好坏分数、速度等标签 2. 机器人使用的控制模态(关节控制信息、 末端执行器控制信息)以及子目标图像世界模型想象的未来几秒任务成功时的画面pi0.7的评估效果-开箱即用在折叠衣服、取出垃圾袋等特定场景下无需任务数据集后训练也表现良好-指令泛化在完全未见过的场景下遵循多样的开放式指令-跨具身泛化将当前机器人的特定复杂任务操作能力迁移到完全未经训练的机器人上-组合任务泛化可以像 LLM 那样组合原子技能来执行新任务总结pi0.7 是为了解决之前 VLA 不能进行组合技能执行任务的情况通过多元化数据集训练时对数据集进行标注添加详细的上下文文本信息、策略元数据、机器人使用的控制模态以及世界模型想象的子目标 image。从而防止 VLA 训练学到多元化数据集的平均策略。最终pi0.7 可以实现开箱即用、跨具身机器人泛化、听懂未见过的指令、组合任务泛化。提问问题分析 / 理解为什么需要策略元数据VLA 不能只学完美成功的数据数据丢掉的好像次优数据的失败经验也很重要它包含了物理世界的规律。2. 相关工作线索笔记栏使用合适的提示设计合适的提示设计使得模型能够利用多样化机器人、互联网、人类操作数据中学到任务与本体之间强大的泛化能力提问问题分析 / 理解为什么合适的提示设计使得模型能够利用多样化的机器人、人类和互联网数据在任务与本体之间实现强大的泛化能力。之前只收集大量多样化数据集的工作为什么泛化能力比较弱LLM 是多样化数据训练大力出奇迹机器人领域盲目堆多样化数据往往会导致灾难性的结果。1.行为策略相冲突数据集 A 是慢慢抓起瓶子数据集 B 是快速抓起瓶子...2. VLA 学到平均化规划动作pi0.7 通过丰富的提示设计,解决数据冲突1.利用元数据消除不同数据集之间的歧义- 现在模型看到的不再是模糊的“抓起杯子”而是- 数据 A“抓起杯子” 质量5 失误否 速度慢- 数据 C“抓起杯子” 质量1 失误是 速度快2. 利用子目标图像实现跨本体泛化- 不管当前机器人长什么样子世界模型根据强大的语义和物理常识想象接下来执行会变成什么样子当前机械臂再去执行3. pi0.7 概述线索笔记栏模型架构基于 pi0.6 以及 MEM 内存系统并在此基础上扩展了多模态上下文条件pi0.6架构Gemma3 4B 视觉语言模型 SigLIP 视觉编码器 400M 流匹配动作专家860 M 模型总参数量约 5BMEM 视频历史编码器全称是Multi-scale Embodied Memory多尺度具身记忆。机器人操作需要记住过去几秒钟发生了什么。但是如果把历史几帧图像都输入 LLM 计算量爆炸。MEM 使用空间压缩、时间压缩。无论你给它塞多少帧的历史视频它都能把它们“压缩”成和单张图片一样少的信息量总结pi0.7 的模型架构就是pi0.6架构然后对视觉编码器加了一个 MEM 编码器。4.多样化提示线索笔记栏总体思想为什么要扩展 Prompt为了让模型能处理包含失败和次优数据在内的多样化数据集。扩展后的提示词不仅告诉模型做什么还明确了“怎么做”“用什么质量做”。做什么总任务和子任务怎么做预测子目标图像用什么质量做策略元数据包括速度、质量、是否失败Prompt 组件1子任务指令定义在总任务指令如“清理厨房”之外补充更细粒度、中间级别的语义步骤。例如总体是清理厨房子任务是“打开冰箱门”。它是实现语言指导的基础。人类可以通过给子任务指令一步步引导机器人完成以前没做过的新任务。Prompt组件2子目标图像子目标图像通常比语言指令更能清晰的消除歧义从而更明确地传达策略的目标定义展示任务推进后多视角未来预期退休昂来源一个轻量级世界模型生成优势提供了比文字更丰富的空间和细节约束。Prompt 组件 3策略元数据痛点训练数据里有大量动作缓慢、失败甚至完全失败的轨迹数据如果用来帮助 VLA 提升能力三个标签维度1.整体速度完成任务花费的步数 2.整体质量 1-5 分5 分最完美。 3.是否失误在动作片段中是否犯错。作用训练时贴标签放置模型学坏“; 推理时通过 Prompt 召唤“最高质量的操作”如强行要求 Quality: 5, Mistake: false。Prompt 组件 4控制模式定义用 文字 标识底层运动的控制方式。分类joint 关节级适合灵巧精细动作ee末端执行器只管机械手的三维空间位置随机暂退提示法训练期间随机去掉提示数据的某个部分这使得 pi0.7 在测试时具有灵活性可以使用提示组件的任意子集带或不带子目标图像的运行完整 Prompt 长什么样子Pasted image 20260721202639.png总结这部分为什么要扩展 Prompt,详细定义了多模态提示词结构 这是模型能实现组合泛化的基础组建。提示词组成视觉图像子目标图像总任务指令子任务指令策略元数据信息整体速度、整体质量、是否失误文字版控制方式标识提问问题分析 / 理解只要子目标图像不要任务指令行不行作者在训练时会有 30%的概率故意把文字指令删掉因为数视觉子目标图像通常能够以更丰富的细节直接替代文字描述。但是子目标图像需要文字指令提示生成关节级和末端执行器指的是机械臂手 和 对应的夹爪吗不是这是两种控制方式。-关节级控制模型把胳膊的 6 个关节角度夹爪的开合度全部直接算出来- 末端执行器控制AI 只算夹爪在三维空间的位置 夹爪的开合度。置于胳膊的关节怎么转交给底层的数学公式去计算。5. pi0.7 模型和训练配方线索笔记栏训练数据集多任务涵盖多种不同机器人平台多样化环境实验室内部、家庭环境大量策略自主收集数据、策略执行过程中的手动干预数据、开源机器人数据、第一人称人类视频数据模型架构与 pi0.5 和 pi0.6 模型相比pi0.7 主要架构来改进是 MEM 的历史视觉编码器以及上下文中的视觉子目标图像模型输入最多四张相机图像前视图、两个腕部视图以及可选的后视图每张图像最多包含六个历史帧以及最多三张子目标图像不包括后视图观测图像与子目标图像使用双向注意力后续文本使用因果注意力6. 运行时提示 pi 0.7线索笔记栏固定元数据信息- 整体质量5 分最高级- 失误永远为 False- 整体速度设置为该任务在训练数据里前 15%快的速度图像指令什么时候刷新生成子目标图像很废时间不是每秒都生成一张新图。作者定了一个规则1.意图改变时比如文字指令从“打开微波炉”变成了“端出盘子”这说明动作进入下一阶段了立刻刷新图像。2. 超时 4 秒 如果一直在做一个动作比如慢慢擦桌子系统设定每隔 4 秒强制刷新一次未来画面。什么是异步推理这是一个纯工程技巧为了防止机器人“卡顿”。- 生成一张子目标图像就算是超级显卡大概也要花 1.25 秒。- 但是机器人的胳膊是每秒钟动 50 次的50 Hz。如果胳膊每动一下都要等图像生成机器人就会像卡带一样动一下停一秒。-解决方案系统开了两个“线程大脑分区”。-慢大脑后台慢慢悠悠地想词儿、画图片。-快大脑前台控制臂只管用 50 Hz 的极快速度输出控制动作。它不等慢大脑慢大脑画出最新的一张图快大脑就拿来用如果有 1 秒钟没新图快大脑就看着上一张旧图继续干活。互不干扰保证动作丝滑。使用“CFG无分类引导”放大招强迫模型听话-为什么用 CFG有时候即便你在提示词里写了 Quality: 5模型还是会犯懒偷偷用平均水平去干活。-CFG 的作用相当于一个“提示词音量放大器”。论文里设置了权重β∈{1.3,1.7,2.2}β∈{1.3,1.7,2.2}。意思是在底层计算概率时系统会对模型大吼“给我加倍注意【质量 5 分】这个标签1.7 倍注意不许忽略”-结果** 使用 CFG 强推元数据后模型会极其努力地逼迫自己做出那些高难度的灵巧动作。

相关新闻

计算机科学家Edward Xie的分布式系统优化方法论

计算机科学家Edward Xie的分布式系统优化方法论

由于提供的输入内容过于简略(仅包含人名"Edward Xie"),缺乏必要的项目描述、关键词和摘要信息,无法生成符合要求的专业博文。根据内容安全原则和创作规范,我需要您补充以下必要信息才能继续:项目…

2026/7/22 2:42:47 阅读更多 →
使用leader-line.js实现网页元素间美观连线

使用leader-line.js实现网页元素间美观连线

1. 项目概述leader-line.js 是一个轻量级的 JavaScript 库,专门用于在网页元素之间绘制美观的指引线。作为一名前端开发者,我最近在项目中遇到了需要在不同 DOM 元素之间建立视觉连接的需求,经过多方调研最终选择了这个库。它不仅配置灵活&am…

2026/7/22 2:41:47 阅读更多 →
深入解析TI HDVPSS:COMP、CIG、GRPX模块与视频合成技术

深入解析TI HDVPSS:COMP、CIG、GRPX模块与视频合成技术

1. 项目概述:从像素到画面的魔法师在任何一个现代多媒体设备里,无论是你手中的智能电视、客厅里的机顶盒,还是商场里的数字标牌,其背后都有一个默默无闻的“画面魔术师”——视频处理子系统。它的核心任务,就是把来自不…

2026/7/22 2:41:47 阅读更多 →

最新新闻

C++部署性能优化实战:从编译到运行的全链路调优指南

C++部署性能优化实战:从编译到运行的全链路调优指南

1. 项目概述:为什么C部署性能优化是门硬功夫最近在社区里看到不少朋友在讨论C项目部署上线后,性能表现不及预期的问题。一个在开发机上跑得飞快的程序,一旦放到生产环境,响应延迟就上去了,资源消耗也居高不下。这其实是…

2026/7/22 4:40:33 阅读更多 →
没有编程基础能搭建外贸AI任务规划系统吗

没有编程基础能搭建外贸AI任务规划系统吗

在当今数字化时代,外贸行业竞争激烈,利用AI进行任务规划成为众多B2B从业者提升效率和竞争力的关键手段。很多没有编程基础的外贸跨境商家也想搭建外贸行业AI任务规划系统,那么这是否可行呢?答案是肯定的。下面我们就来详细探讨。外…

2026/7/22 4:40:33 阅读更多 →
YOLO11改进模型在粮虫检测中的实践与优化

YOLO11改进模型在粮虫检测中的实践与优化

1. 项目背景与核心挑战粮食储藏过程中的虫害识别一直是农业质检领域的痛点问题。传统人工抽检方式存在效率低、漏检率高的问题,而基于计算机视觉的自动化检测方案正逐渐成为行业新标准。我们团队在实际项目中发现,通用目标检测模型在应对粮仓复杂环境时存…

2026/7/22 4:40:33 阅读更多 →
知识图谱与Dify集成:RAG技术的企业级应用实践

知识图谱与Dify集成:RAG技术的企业级应用实践

1. 知识图谱与Dify集成的核心价值在当今企业级AI应用开发中,RAG(检索增强生成)技术已成为连接私有数据与大语言模型的关键桥梁。而知识图谱作为结构化数据的黄金标准,其与Dify平台的深度整合,能够为AI应用带来三个维度…

2026/7/22 4:40:33 阅读更多 →
XHS-Downloader小红书下载工具:零基础快速上手完整指南

XHS-Downloader小红书下载工具:零基础快速上手完整指南

XHS-Downloader小红书下载工具:零基础快速上手完整指南 【免费下载链接】XHS-Downloader 小红书(XiaoHongShu、RedNote)链接提取/作品采集工具:提取账号发布、收藏、点赞、专辑作品链接;提取搜索结果作品、用户链接&am…

2026/7/22 4:40:33 阅读更多 →
视频创作版权避坑指南:音乐、字体与图片安全使用方案

视频创作版权避坑指南:音乐、字体与图片安全使用方案

1. 视频创作中的版权避坑指南最近帮几个做自媒体的朋友处理了几起版权投诉,发现很多内容创作者对视频中的音乐、字体、图片版权问题存在严重认知盲区。今天就用我处理过的实际案例,拆解这三个最容易踩雷的版权陷阱。2. 音乐版权:看不见的高压…

2026/7/22 4:39:33 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻