一个更刁钻的问题——如果我的部署模型是少步生成器,还能不能愉快地吃下 RL 的奖励?
论文MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators项目页 | GitHub | Hugging Face作者团队Tencent Hunyuan一、为什么这篇论文值得你停下来读如果你接触过MeanFlow、DMD、CDM、AnyFlow这类少步生成器你一定被一个问题折磨过模型是少步了但想做奖励对齐RL finetuning时怎么套都套不稳。少步生成器靠“平均速度”做大步采样而 DiffusionNFT 这类 forward-process RL 原本优化的是“瞬时速度”。两者看起来都属于 flow/diffusion 后训练但接口并不一样不能简单把 DiffusionNFT 直接套到 MeanFlow 上。MeanFlowNFT提出了一个干净利落的解决方案推理时仍然保留 MeanFlow 的平均速度和少步采样训练时从平均速度网络里构造一个诱导的瞬时速度预测器再把 DiffusionNFT 的负样本感知奖励目标作用到这个诱导速度上。这样既能吃到 forward-process RL 的奖励优化又不牺牲 MeanFlow 的4-step / few-step 部署优势。这不是又一个在少步模型上硬塞 RL 的“补丁”工作——它从根上回答了“average-velocity generator 的 RL 接口应该长什么样”并把它落地到了Wan2.1 视频生成的真实场景里拿到了VBench 84.33的硬指标。二、核心思想从“瞬时速度”到“平均速度”的接口适配2.1 传统 DiffusionNFT 在做什么DiffusionNFT 的核心是forward-process negative-aware finetuning用旧策略采样用 reward 区分好坏再在 forward matching 中构造正负方向。它面对的是瞬时速度模型所以目标直接作用在瞬时速度 v_theta 上。这套方法在多步扩散模型上效果不错但当我们把它硬套到少步生成器时问题来了平均速度跟瞬时速度在参数化上根本不是一回事。2.2 MeanFlowNFT 的做法构造诱导瞬时速度MeanFlowNFT 的关键改造是一个“接口层”。它不直接把 DiffusionNFT 套在平均速度 u 上而是先构造一个和 DiffusionNFT 接口兼容的瞬时速度对象 V。理解这篇文章最容易卡在符号上。论文里有三类速度符号名称含义vinstantaneous velocity某个时间点 t 上的瞬时速度场传统 Flow Matching 或 DiffusionNFT 主要在这个空间里工作uaverage velocityMeanFlow 的“平均速度”描述从时间 t 到更早时间 s 整个区间的平均速度天然适合少步生成Vinduced instantaneous velocity predictor从平均速度网络 u_theta 诱导出来的瞬时速度预测器不是独立网络由 u_theta、时间导数和空间导数组合而来训练目标作用在V上但参数更新最终回到u_theta。2.3 一句话总结区别维度直接套 DiffusionNFTMeanFlowNFT优化对象直接优化瞬时速度从平均速度诱导出瞬时速度再优化推理效率可能破坏少步结构保留MeanFlow 的 4-step 少步采样训练稳定性容易崩塌有理论保证训练更稳能否迁移到视频不稳定Wan2.1 上拿到 84.33三、三种速度先分清u、v、V 不是一回事公式一MeanFlow 的采样身份这个公式说明 MeanFlow 为什么能少步采样x_t是当前噪声状态x_s是更早时间 s 的状态u_theta(x_t,s,t)是模型预测的从 t 到 s 的平均速度。只要平均速度预测准确就可以用一次大步更新从 x_t 直接跳到 x_s而不是像普通 ODE solver 那样做很多细小瞬时速度积分。公式二诱导瞬时速度 V_theta 是怎么来的这条公式是 MeanFlowNFT 的核心。左边V_theta(x_t,s,t)是要拿去做 RL 优化的诱导瞬时速度。右边第一项u_theta(x_t,s,t)是 MeanFlow 原本预测的平均速度后面乘以t-s的大括号项是平均速度沿时间和状态变化的总导数修正。直觉上这个公式是在问如果一个区间平均速度 u 想对应某个真实瞬时速度那么它不仅要给出区间平均值还要补偿这个平均值随时间和状态变化的趋势。这一步的意义是把 MeanFlow 的 average-velocity 参数化翻译成 DiffusionNFT 能理解的 instantaneous-velocity 接口。没有这个翻译直接把 DiffusionNFT 套到 u 上会丢掉理论保证也容易训练不稳。公式三MeanFlowNFT 的奖励加权目标这个损失函数可以按正负两条线读高奖励样本推动模型朝高奖励方向靠近低奖励样本从低奖励方向拉开这个结构继承了 DiffusionNFT 的negative-aware思想不是只学习好样本而是同时利用低奖励样本形成反方向约束。四、训练流程一轮更新到底发生了什么MeanFlowNFT 的一次训练更新可以拆成六步采样 prompt c用旧的 MeanFlow 策略 u_old 做少步 rollout 得到 x0Reward model 对 x0 和 c 打分得到 r随机采样时间区间 s ≤ t 和噪声 epsilon走 forward process 得到 x_t同时计算条件速度 v_t用 u_old 的有限差分估计总导数项构造 V_theta、V_old、V_theta、V_theta-用奖励加权的 MSE 更新 theta这里和 reverse-process RL 最大不同是训练不需要展开完整反向生成轨迹也不需要每一步 likelihood。它把奖励优化重新写进 forward matching 目标里因此更像“带奖励的流匹配后训练”而不是普通策略梯度。五、工程细节两个让大规模训练成为可能的关键设计5.1 有限差分为什么不用自动微分理论公式里有 partial_t u_theta 和 partial_x u_theta 乘 v_hat_theta本质是 Jacobian-vector product。直接用自动微分算 JVP 很贵而且和大规模 FSDP 训练兼容性差。论文实际实现用central finite difference近似总导数沿着速度方向把 x_t 和 t 向前/向后挪一个很小的 delta t再看 u_old 的差分。这有两个工程意义避免了昂贵的高阶自动微分让 MeanFlowNFT 可以放到视频模型这种更大规模训练里否则一个理论上漂亮的诱导速度公式可能因为计算成本而无法用于Wan2.1这类模型。5.2 共享导数为什么让新旧策略共享导数更稳论文强调shared total derivative。原因在于u_theta 和 u_old 通过 EMA 保持接近但它们各自的导数不一定接近。如果正负预测器用各自导数差异项会被导数噪声放大训练信号就不再是受控的 u_theta - u_old而可能变成不稳定的导数差。论文选择让两者共享由 u_old 估计的导数这样 V_theta 和 V_old 的差异主要来自平均速度本身。六、实验结果从图像到视频4 步打出全场最佳6.1 图像生成SD3.5-M 上的全面领先在 1024 分辨率下MeanFlowNFT 在 few-step 组里多项指标拿到最佳指标MeanFlowNFT (4-step)说明ImageReward1.4504最高CLIPScore0.2967最高PickScore23.5019最高HPSv20.3269最高GenEval20.2375最高OCR0.6534最高这个结果说明它不是只优化单一 reward而是在多种偏好、文本对齐、OCR 和综合生成指标上同时改善。表里还暴露了直接套 DiffusionNFT 的问题DMD DiffusionNFT、CDM DiffusionNFT 的指标并不稳定甚至 HPSv3 出现明显退化。这支持论文的主张少步生成器需要匹配自身参数化的 RL 目标不能把 forward-process RL 当成即插即用外挂。6.2 视频生成Wan2.1 4 步冲到 VBench 84.33这是最让人兴奋的部分。MeanFlowNFT 在Wan2.1 1.3B视频生成上指标MeanFlowNFT (4-step)说明VBench Total84.33最高Quality85.99最高HPSv3-G6.5959最高HPSv3-P10.793最高MQ (运动质量)0.9535最高更关键的是它还超过了 50-step 的 Wan2.1 LongCat-Video RL在所有报告指标上的数值同时函数评估步数少得多。对视频来说少步采样尤其重要因为每一步都要处理时空 token步数减少会直接影响成本和交互速度。七、测试时步数扩展不是只能固定 4 步MeanFlowNFT 在多数步数上保持领先并且随着步数增加仍能获得一定收益。这说明它没有把模型训练成只能在固定 4 步下工作而是保留了 MeanFlow/AnyFlow 类模型的 any-step 或 test-time scaling 特性。对部署很重要低延迟场景可用 4 步高质量离线场景可增加步数。八、理论保证不是纯经验拼接论文的 policy-improvement 保证建立在 idealized setting 上证明诱导预测器的点态最优解等价于旧诱导速度加上一项奖励方向 Delta说明当 beta 与 alpha 匹配时V_theta* 可以恢复 improved policy 的 marginal instantaneous velocity v^利用 MeanFlow consistency 把这个瞬时速度保证转回平均速度网络 u_theta这不是说现实训练一定单调变好。现实里有有限模型容量、有限差分误差、reward 噪声、EMA 滞后和优化不完全。但它至少说明 MeanFlowNFT不是纯经验拼接如果诱导速度目标能被学到那么平均速度采样器对应的策略也应该朝改进策略移动。九、和 DiffusionNFT 的关系继承思想但不是直接套用DiffusionNFT 的核心是 forward-process negative-aware finetuning。MeanFlowNFT 继承了这套思想但关键改造是接口层。DiffusionNFT 面对的是瞬时速度模型所以目标直接作用在 v_theta 上。MeanFlowNFT 面对的是平均速度模型所以必须先从 u_theta 诱导出 V_theta。这个“接口适配”就是文章的核心贡献。没有它平均速度网络会被错误地当成瞬时速度网络优化理论和训练稳定性都会受损。十、谁应该关注这个项目人群你能从中获得什么少步生成模型研究者一个让 average-velocity generator 吃上 RL 奖励的通用框架视频生成工程师Wan2.1 上 4 步 VBench 84.33 的实战方案扩散模型后训练爱好者forward-process RL 从瞬时速度到平均速度的接口适配方法论RLHF / 奖励对齐从业者少步模型做奖励优化时避免训练崩塌的关键设计AI 产品经理少步 更快的推理 更低的部署成本十一、总结少步生成器 RL 的“接口层”革命在大家都在卷“多步扩散怎么对齐奖励”的时候MeanFlowNFT 问了一个更前置的问题如果我的部署模型天生就是少步的RL 的接口应该怎么设计它不追 SOTA 刷分没有去卷更大的模型而是扎进了“average-velocity generator 的 RL 接口”这个被忽视的基础问题理论扎实诱导瞬时速度、policy-improvement 保证、有限差分实现三件事环环相扣工程落地Wan2.1 视频生成上 4 步 VBench 84.33超过 50-step 的 LongCat-Video RL诚实透明明确指出有限差分误差、reward noise、EMA 滞后等现实约束如果你正在做少步生成模型、视频生成、扩散模型后训练或者单纯对“如何让少步模型吃下 RL 奖励”感兴趣这篇论文绝对值得你精读、复现、迁移。论文地址arXiv 2607.15273项目页MeanFlowNFT Project Page代码GitHub · Hugging Face作者团队Tencent HunyuanMeanFlowNFT: bringing forward-process RL to average-velocity generators.

相关新闻

C++游戏开发实战:从环境配置到ECS架构与性能优化

C++游戏开发实战:从环境配置到ECS架构与性能优化

1. 项目概述与核心思路 “C 游戏开发示例(三)”这个标题,听起来像是某个系列教程的第三部分。对于正在学习C游戏开发的朋友来说,这通常意味着内容会深入到更具体的游戏机制、性能优化或者复杂系统的实现。从网络热词来看&#xf…

2026/7/21 23:58:25 阅读更多 →
Python ageliaco-rd 包:功能详解、安装配置与实战案例

Python ageliaco-rd 包:功能详解、安装配置与实战案例

1. 引言ageliaco-rd 是一个面向 Python 生态的专业数据处理与算法加速包,专注于提供高性能的数值计算、数据读取与分布式处理能力。本文将从功能特性、安装配置、核心语法与参数、8 个实际应用案例以及常见错误与注意事项五个维度,全面介绍 ageliaco-rd …

2026/7/21 23:58:25 阅读更多 →
各平台AIGC率要求降到多少?讲清标准和降的方法

各平台AIGC率要求降到多少?讲清标准和降的方法

各平台AIGC率要求降到多少?讲清标准和降的方法 你现在最想要一个明确的数字:AIGC 率到底降到多少才算过?是低于 20% 就行,还是得压到 10% 以内,还是干脆越低越好?你翻了半天,发现每个人说的都不…

2026/7/21 23:58:25 阅读更多 →

最新新闻

5大高效安全策略:现代curl证书钉扎技术的完整架构实践

5大高效安全策略:现代curl证书钉扎技术的完整架构实践

5大高效安全策略:现代curl证书钉扎技术的完整架构实践 【免费下载链接】curl A command line tool and library for transferring data with URL syntax, supporting DICT, FILE, FTP, FTPS, GOPHER, GOPHERS, HTTP, HTTPS, IMAP, IMAPS, LDAP, LDAPS, MQTT, MQTTS,…

2026/7/22 2:00:35 阅读更多 →
KVM虚拟化技术部署与性能优化指南

KVM虚拟化技术部署与性能优化指南

1. KVM虚拟化技术概述KVM(Kernel-based Virtual Machine)作为Linux内核原生支持的虚拟化解决方案,已经成为企业级虚拟化部署的首选技术之一。与传统的Type-2虚拟化方案不同,KVM直接利用Linux内核作为hypervisor,通过硬…

2026/7/22 2:00:35 阅读更多 →
Solid Explorer 高级版 v3.5.13 | 安卓文件管理器深度体验

Solid Explorer 高级版 v3.5.13 | 安卓文件管理器深度体验

软件介绍 Solid Explorer 是一款功能强大的 Android 文件管理器,支持双窗格操作与多种云服务集成,具备本地及远程文件统一管理能力,提供 Root 访问、压缩处理与媒体预览等功能,显著提升移动设备上的文件操作效率。 下载地址&…

2026/7/22 2:00:35 阅读更多 →
HarmonyOS 应用开发《掌上英语》第29篇:首页数据聚合——从多个 Manager 到统一的视图模型

HarmonyOS 应用开发《掌上英语》第29篇:首页数据聚合——从多个 Manager 到统一的视图模型

首页数据聚合——从多个 Manager 到统一的视图模型引言 在实际的 HarmonyOS 应用开发中,一个页面往往需要从多个数据源获取数据。例如首页可能需要同时展示今日学习进度(来自 LearningPlanManager)、生词本数量(来自 NewWordManag…

2026/7/22 2:00:35 阅读更多 →
2026年横评10款降AI率平台:帮你锁定真正好用靠谱的一款

2026年横评10款降AI率平台:帮你锁定真正好用靠谱的一款

AI写作工具的兴起让论文写作和内容创作变得前所未有的高效,无论是学生还是职场人士,都能借助这些工具快速完成初稿。然而,随着AIGC检测技术的不断升级,问题也随之而来:越来越多的高校、期刊和平台开始严格筛查AI生成内…

2026/7/22 2:00:35 阅读更多 →
Windows XP任务管理器详解与进程管理实战

Windows XP任务管理器详解与进程管理实战

1. Windows XP任务管理器概述Windows XP的任务管理器(Task Manager)是系统内置的进程监控与管理工具,它为用户提供了直观的系统资源使用情况和进程管理界面。与后续版本相比,XP的任务管理器虽然功能相对简单,但其核心设…

2026/7/22 1:59:34 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻