强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (7)--- Policy Serving
0x00 概要本系列的目的是借着对 OpenClaw-RL 源码的学习来梳理强化学习的一些相关概念和思想。所以会有一些基础知识、扩展和发散OpenClaw-RL 只是一个切入点。而且因为整篇系列是一个整体所以有些概念的解读/学习会在不同的文章中出现还请大家谅解。OpenClaw-RL 是一个用于在线强化学习Online RL的框架专门针对智能体工具使用场景。它通过从环境反馈中提取过程奖励信号来训练语言模型支持三种主要模式openclaw-rl基于二元奖励的强化学习Binary RL / GRPOopenclaw-opd基于后见之明提示的在线策略蒸馏On-Policy Distillation, OPDopenclaw-combine联合方法在同一 PPO 更新中同时利用 RL reward 和 OPD teacher signalframeworkOpenClawAPIServer是OpenClaw-RL系统中的核心组件它充当OpenClaw环境与 SGLang推理服务之间的代理服务器负责收集训练数据、计算奖励并提交样本给强化学习训练流程。当然也可以认为OpenClawAPIServer即是 Proxy Server也是 Policy Serving。0x01 基础1.1 架构我们回顾 OpenClaw-RL 的系统架构图如下整体架构1.2 OpenClawAPIServer 的定位OpenClawAPIServer 这个名字其实不准确更准确的命名应该是OpenClawProxyServer 或OpenClawTrainingPipeline—它是连接Policy Serving、Reward Judging 和Policy Training 三个功能层的协调器Orchestrator而非其中任何一层的实现体。职责以 OpenClawAPIServer 为例它独自承担了几个职责职责 属于哪个组件 具体代码HTTP 代理转发用户请求 Policy Serving接口层 httpx.post(sglang_chat_url)拦截 response logprobs Policy Serving数据采集 _extract_logprobs_from_chat_response()PRM 评分 Reward Judging _fire_prm_scoring() / _opd_evaluate()构造训练 Sample 训练数据管道 _submit_turn_sample()开关控制503 训练-服务调度 submission_enabled.is_set()类比OpenClawAPIServer “前台服务员数据记录员不是“厨房Policy本身。类比 对应组件餐厅服务员接单、传菜 OpenClawAPIServer厨房真正做菜 SGLang GPU 4-5Policy 推理食品检验员给菜打分 SGLang GPU 6-7PRM/Judge餐厅管理系统记录点单数据 output_queue → Slime1.3 继承关系 方法覆盖OpenClawAPIServer、OpenClawOPDAPIServer 和 OpenClawCombineAPIServer 的关系如下OpenClawAPIServer (Binary RL 基类, 独立)├─ _submit_turn_sample() score-loss_mask, at-least-one├─ _maybe_submit_ready_samples() 检查 PRM task done└─ _fire_prm_scoring() 触发 PRM 异步OpenClawOPDAPIServer (独立类, 不继承 OpenClawAPIServer)├─ _submit_turn_sample() 独立实现├─ _maybe_submit_ready_samples() 改用 opd_evaluate task├─ _opd_evaluate() hint judge teacher lp 计算├─ _fire_opd_task() 触发 OPD 异步评估└─ _compute_teacher_log_probs() / _compute_teacher_topk_logprobs()OpenClawCombineAPIServer extends OpenClawOPDAPIServer├─ _submit_turn_sample() ← 覆盖: OPD/OPDRL 路径├─ _submit_rl_turn_sample() ← 新增: RL-only 路径 (teacherrollout)└─ _maybe_submit_ready_samples() ← 覆盖: 3路分发逻辑1.4 真实策略服务器OpenClawAPIServer 的技术栈FastAPIWeb框架异步UvicornASGI 服务器基于uvloop高并发httpx/aiohttp异步 HTTP 客户端调用 SGLang和PRM真正的Policy Server是SGLangGPU4-5PolicyQwen3-4B模型权重 (注: RL server 默认 SERVED_MODEL_NAME“qwen3-8b”, OPD server 默认“qwen3-4b”, 实际部署可通过环境变量覆盖)Policy ServerSGLang推理引擎监听sglang_router_ip:sglang_router_portOpenClawAPIServer不运行模型推理它只是SGLang前面的一层拦截代理。用户 → OpenClawAPIServerFastAPI, Proxy → SGLangGPU4-5← 真正的Policy Server↓ 拦截SGLang PRM (GPU 6-7) ← Reward Judge评分↓output_queue↓Slime ← Policy Training的数据入口请求处理调用链HTTP 入口chat_completions()回合判断_handle_main_turn()/_handle_side_turn()SGLang 转发forward_to_sglang()PRM 触发_fire_prm_scoring() →_prm_evaluate()样本提交maybe_submit_ready_samples()→output_queue.put()样本构建调用数据缓冲_buffer_record()→存入_pending_records状态刷新flush_pending_record()→添加下一状态样本构建_submit_turn_sample()→创建Sample 对象FastAPI Proxy 如何转发到 SGLangOpenClawAPIServer 通过 FastAPI Proxy 实现了对外的入口内部通过 SlimeRouter 路由到实际的 SGLang 推理引擎, 实现了接入层与推理层的解耦。完整端口与中间层架构如下图所示。7-中间层架构端口关系总结 (run_qwen3_4b_openclaw_rl.sh 配置):PORT30000- FastAPI Proxy 监听端口 (外部可见, OpenClaw App 连接此处)args.sglang_router_ip/port- Slime 自动分配, 传给 API Server 作为 sglang_chat_url 的目标- 指向 SlimeRouter (内部负载均衡层)args.prm_router_ip/port- PRM Engine 的 /generate 地址 (GPU 6-7)- API Server 用于发送评分请求1.5 对比标准 RL Policy Serving:rollout时SGLang只服务训练系统内部批量生成→批量打分→批量训练无外部访问架构[训练系统 ⇆ [SGLang] 内部通信OpenClaw Policy Serving:rollout 时SGLang同时服务实用户通过OpenClawAppPRM评分内部调用Teacher forward passOPD 时架构[用户手机] → [FastAPI Proxy] → [SGLang] 外部流量[PRM judge] → [SGLang] 内部调用[训练系统] ← [Proxy] 数据管道工程挑战这导致了独特的工程挑战标准 RL 不需要处理的问题 OpenClaw 需要处理───────────────────── ────────────────────────❌ API 认证 ✅ SGLANG_API_KEY❌ 并发控制 ✅ semaphore❌ 503 暂停 ✅ submission_enabled❌ session 管理 ✅ X-Session-Id❌ 流式传输 ✅ SSE streaming❌ 用户体验 ✅ 低延迟响应❌ 数据筛选 ✅ main vs side turn❌ 超时处理 ✅ session timeout总结OpenClaw 的根本范式转变标准 RL 训练系统是 “主人” → 它决定问什么、答几次、怎么评分OpenClaw 训练系统是 “寄生者” → 它寄生在真实对话上被动收集数据这导致OpenClaw-RL Serving 如下特点Rollout 被动等待不是主动生成Environment 真实用户不是模拟器PRM 即用即评不是预训练 RMPolicy 对外服务不是内部推理一切设计选择都源于这个范式转变。0x02 详细功能梳理OpenClawAPIServer 本质上是一个智能代理它不仅转发请求还负责收集强化学习所需的训练数据通过PRM评估助手响应质量并将高质量的数据提交给训练流程。OpenClawOPDAPIServer 则是OPD模式的专用API服务器。2.1 OpenClawAPIServer

相关新闻

找网站建设公司,三种公司千万别碰!

找网站建设公司,三种公司千万别碰!

找网站建设公司,三种公司千万别碰!第一,不给源码的,直接pass,前期的投入,后期一换服务商全都打水漂!第二类要选十年以上的网站建设公司,网站建设属于轻资产行业,时间越长…

2026/7/22 9:44:24 阅读更多 →
企业级AI模型接入的协议适配与安全合规选型指南

企业级AI模型接入的协议适配与安全合规选型指南

背景:2026年国内团队调用海外大模型的现实瓶颈 进入2026年下半年,以Claude Sonnet 5.1、Opus 4.8为代表的海外大模型,在复杂逻辑推演、超长上下文理解及代码生成领域的优势依然显著。然而,国内开发者在实际生产环境接入时&#xf…

2026/7/22 9:44:24 阅读更多 →
GLM与Kimi Code技术协同:AI编程助手API集成实战指南

GLM与Kimi Code技术协同:AI编程助手API集成实战指南

最近在AI编程助手领域,一个值得关注的现象是:智谱GLM团队的技术专家们开始频繁为Kimi Code功能"打Call"。这不仅仅是简单的商业互吹,而是标志着国产AI编程工具正在进入一个全新的发展阶段。 如果你还在纠结"豆包跟Kimi哪个好…

2026/7/22 9:44:24 阅读更多 →

最新新闻

Cesium GPU粒子系统:大规模动态数据流畅可视化实战

Cesium GPU粒子系统:大规模动态数据流畅可视化实战

在三维地球可视化项目中,你是否遇到过这样的场景:想要展示风场流动、污染物扩散、或者海洋洋流运动,却发现传统的标记点和线框动画显得生硬且性能低下?特别是在处理大规模动态数据时,CPU计算的粒子系统往往卡顿明显&am…

2026/7/22 10:30:43 阅读更多 →
苏州科技大学Material Sciences:190毫秒升至2740 K,碳热冲击把树叶转化为乱层石墨烯

苏州科技大学Material Sciences:190毫秒升至2740 K,碳热冲击把树叶转化为乱层石墨烯

1. 背景乱层石墨烯由石墨烯片层错位、旋转和无序堆垛形成,弱层间耦合和较大的层间错配使其在离子传输、电荷传导、储能和电催化等方向具有潜在优势。相比机械剥离、CVD 和氧化还原等传统路线,生物质前驱体来源广、成本低、含碳量高,是制备碳材…

2026/7/22 10:30:43 阅读更多 →
小程序商城怎么选才能符合自己的需求?2026四个必看指标教你不花冤枉钱

小程序商城怎么选才能符合自己的需求?2026四个必看指标教你不花冤枉钱

2026年小微商家数字化调研数据显示,71%的商家在搭建小程序商城时存在预算超支问题,超62%的中小商家因为隐性扣费导致年度实际支出超出初始预算30%以上。更扎心的是,很多超支不是因为"选了贵的平台",而是"选了不匹配…

2026/7/22 10:30:43 阅读更多 →
【已复现】Fastjson 1.2.83 Gadget 黑名单失效--Fastjson 1.2.83 远程代码执行

【已复现】Fastjson 1.2.83 Gadget 黑名单失效--Fastjson 1.2.83 远程代码执行

前言这周安全圈最热闹的事,莫过于 Fastjson 1.2.83 RCE 了。Fastjson 是阿里巴巴开源的一款高性能 Java JSON 解析库,凭借出色的解析速度和简洁的 API 设计,在国内 Java 生态中占据主导地位,广泛应用于企业后端服务、微服务网关、…

2026/7/22 10:30:43 阅读更多 →
Tiva™微控制器定时器GPTM深度解析:从原理到PWM、RTC实战应用

Tiva™微控制器定时器GPTM深度解析:从原理到PWM、RTC实战应用

1. 微控制器定时器:嵌入式系统的“心跳”与“节拍器”在嵌入式系统的世界里,如果说CPU是大脑,负责思考和决策,那么定时器就是心脏和节拍器,为整个系统提供稳定、精确的时间基准和事件驱动源。无论是让一个LED灯以1秒的…

2026/7/22 10:30:43 阅读更多 →
中小企业GEO轻量化方案:低成本高回报的实战路径

中小企业GEO轻量化方案:低成本高回报的实战路径

引言 预算有限的中小企业,如何用10万元实现GEO(生成式引擎优化)的初步落地?本文基于迪普智见(DeepIntelli)的实战经验,提供一套轻量化方案,涵盖工具选择、关键词策略、社媒利用和预…

2026/7/22 10:29:43 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻