OpenAI Agent Builder和Evals将在11月30日下线:开发者迁移Agents SDK完整清单
文章摘要OpenAI已经明确Agent Builder和平台内Evals产品将在2026年11月30日后停止提供。对于仍依赖可视化工作流、平台数据集、Trace评分和自动化评测的团队这不是简单替换一个API而是需要重新梳理工作流定义、工具调用、状态管理、评测数据和上线治理。本文给出一套从资产盘点、代码化迁移、评测重建、双轨验证到最终切换的完整执行方案。一、哪些产品会受到影响OpenAI在AgentKit页面的更新说明中明确表示Agent Builder Evals将在2026年11月30日后停止提供。官方给出的迁移方向是需要以代码持续运行的工作流 → Agents SDK 更适合自然语言配置的业务场景 → ChatGPT中的Workspace Agents需要注意这并不等于以下能力全部消失Responses APIAgents SDKTool CallingFile SearchWeb SearchComputer UseChatKit模型API自己维护的评测系统。真正需要迁移的是建立在Agent Builder可视化编排和平台Evals产品之上的工作流与质量流程。二、为什么不能等到11月再迁移Agent Builder通常不只是画了几个节点它可能隐含了Prompt分支条件工具配置MCP连接Guardrail人工审批模型参数错误重试版本历史发布环境。Evals则可能保存测试数据集评分规则Trace模型对比Prompt版本人工标注自动评分结果。如果临近下线才开始迁移最容易发生找不到完整Prompt版本不知道某个节点为什么存在无法复现平台中的默认行为历史评测结果无法与新系统对齐新旧系统没有足够时间并行验证工具权限和密钥配置遗漏上线后才发现成本明显上升。建议把迁移拆成三个阶段7—8月资产盘点与目标架构 9—10月代码迁移与双轨运行 11月冻结旧系统并完成切换三、第一步导出工作流资产清单不要先写代码先形成完整资产表。建议每个Agent Builder工作流记录workflow_id workflow_name 业务负责人 技术负责人 当前模型 入口方式 节点数量 工具列表 MCP Server 数据源 Prompt版本 人工审批点 重试规则 超时 日调用量 单次成本 失败率 是否生产使用可以使用表格资产必须记录的内容PromptSystem、User模板、变量、默认值节点类型、输入、输出、分支条件工具名称、Schema、鉴权、风险等级数据File Search、向量库、连接器状态Thread、Session、Memory安全Guardrail、审批、敏感字段评测数据集、评分器、基线结果发布环境、版本、流量、回滚方案还应给工作流分级P0核心生产业务 P1内部高频使用 P2试点或低频 P3实验和废弃候选优先迁移P0和P1不要把时间浪费在已经没人使用的实验流程上。四、第二步把可视化节点转成代码组件迁移不是把整个画布写成一个超长函数。建议拆成Agent定义 Tool定义 Workflow编排 State模型 Guardrail Persistence Observability Evaluation一个最小的代码化结构agent-project ├── agents │ ├── classifier.py │ ├── researcher.py │ └── responder.py ├── tools │ ├── search_customer.py │ ├── query_order.py │ └── create_ticket.py ├── workflows │ └── support_workflow.py ├── guardrails │ ├── input_guard.py │ └── output_guard.py ├── evals │ ├── datasets │ ├── graders │ └── regression.py └── app.py每个可视化节点都应该回答输入类型是什么 输出类型是什么 是否可重试 是否有副作用 是否需要状态 失败后怎么办 是否需要人工确认五、分支条件不要继续依赖自然语言猜测Agent Builder中的分支可能由模型分类退款问题 技术问题 账户问题 其他问题迁移时应把输出改成结构化对象{category:REFUND,confidence:0.93,reason:用户明确要求退回已支付订单}然后使用确定性代码路由defroute_category(result:dict)-str:categoryresult[category]confidenceresult[confidence]ifconfidence0.75:returnhuman_reviewroutes{REFUND:refund_agent,TECHNICAL:technical_agent,ACCOUNT:account_agent}returnroutes.get(category,general_agent)不要把高风险流程建立在不可追踪的自由文本判断上。六、工具迁移时重点检查权限可视化平台可能替你完成了一部分连接配置但代码化后必须明确谁可以调用 可以操作哪些数据 参数范围是什么 是否有副作用 是否需要审批 如何幂等 如何审计工具定义建议增加元数据fromdataclassesimportdataclassfromenumimportStrEnumclassRiskLevel(StrEnum):LOWlowMEDIUMmediumHIGHhighdataclass(frozenTrue)classToolPolicy:name:strrisk_level:RiskLevel requires_confirmation:boolrequired_permissions:tuple[str,...]timeout_seconds:intmax_retries:int高风险工具包括支付退款删除数据修改权限创建外部订单发送正式邮件更新客户信息。模型只能提出调用建议最终授权必须由业务代码完成。七、状态与Memory需要单独设计迁移后不要把全部状态塞进Prompt。至少区分对话状态当前用户问题 最近几轮消息 当前语言 当前任务业务状态订单号 审批状态 任务进度 已完成步骤 工具执行结果长期记忆用户偏好 历史摘要 长期项目资料建议使用显式Statefromdataclassesimportdataclass,fielddataclassclassWorkflowState:trace_id:struser_id:strtask_status:strPENDINGcurrent_step:str|NoneNonecompleted_steps:list[str]field(default_factorylist)tool_results:dictfield(default_factorydict)需要跨请求恢复的状态应进入数据库或持久化Checkpoint而不是只保存在进程内存。八、如何重建Evals能力平台Evals下线后评测不能退回到“人工看几条回答”。建议建立四层评测1. 确定性校验适合JSON是否合法必填字段工具名称参数范围是否泄露敏感字段是否引用不存在的订单。2. 规则评分例如客服回答是否说明处理结果 是否给出下一步 是否包含禁止承诺 是否要求不必要的个人信息3. 模型评分适合评估相关性完整性忠实度语气推理质量。4. 人工抽检高风险业务必须保留人工评审。评测数据结构{case_id:CS-001,input:{message:我要取消订单A1001},expected:{intent:CANCEL_ORDER,requires_confirmation:true},forbidden:[未确认直接取消,修改其他订单]}九、Trace评测应该如何保留Agent质量不能只看最终回答。需要保存完整轨迹用户输入 → 模型决策 → 工具选择 → 工具参数 → 工具结果 → 下一步决策 → 最终回答建议记录trace_id workflow_version prompt_version model step_no tool_name arguments_hash tool_status latency_ms input_tokens output_tokens total_cost final_status可以分别计算任务完成率工具选择准确率参数准确率重复调用率人工接管率平均步骤数单任务成本P95耗时。十、新旧系统如何双轨验证不要直接关闭旧工作流。推荐影子运行真实请求 → 旧系统正常处理 → 同时复制给新系统 → 新系统结果不返回用户 → 比较两套轨迹和结果对比维度指标旧系统新系统任务成功率平均步骤数工具错误率平均成本P95耗时人工接管率当新系统连续达到目标后再逐步导流1% → 10% → 30% → 50% → 100%十一、迁移过程中最容易漏掉什么1. 默认Prompt可视化节点可能存在平台默认指令迁移后行为发生变化。2. 工具超时旧平台可能自动处理代码中却没有设置。3. 重试叠加HTTP层、工具层和Agent层同时重试成本迅速放大。4. 密钥权限迁移时直接复用高权限账户增加安全风险。5. 评测基线只保存平均分没有保存逐条结果无法定位退化。6. 版本映射不知道旧工作流版本对应哪个Prompt和工具版本。十二、建议迁移时间表7月下旬导出全部工作流标记P0—P3冻结无价值流程建立迁移负责人。8月完成目标架构迁移工具与权限重建State和Trace迁移首批P0工作流。9月建立评测数据集影子运行修复行为差异完成P1流程迁移。10月灰度切流完成成本和性能优化演练回滚停止新增旧平台流程。11月全量切换导出最终历史数据关闭旧凭证和连接完成审计归档。总结Agent Builder和Evals下线对生产团队而言不是一次简单的产品替换而是一次Agent工程治理重构。最稳妥的迁移方式是资产盘点 → 工作流代码化 → 权限重新设计 → 状态持久化 → 评测重建 → 影子运行 → 灰度切换越早开始双轨验证越能避免11月集中迁移带来的业务风险。

相关新闻

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer是一款开源工具&#…

2026/7/21 18:36:51 阅读更多 →
如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 [特殊字符]

如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 [特殊字符]

如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 🎨 【免费下载链接】krita-ai-diffusion Streamlined interface for generating images with AI in Krita. Inpaint and outpaint with optional text prompt, no tweaking required. 项目…

2026/7/21 18:36:51 阅读更多 →
Codex CLI实战指南:AI编程代理的安装配置与核心使用技巧

Codex CLI实战指南:AI编程代理的安装配置与核心使用技巧

如果你是一名开发者,最近一定在各种技术社区和社交平台上频繁看到“Codex”这个词。它被描述为“AI编程代理”、“终端里的编程助手”,甚至有人称之为“Copilot的终端版本”。但当你真正想去尝试时,却发现官方渠道访问困难,安装过…

2026/7/21 18:36:55 阅读更多 →

最新新闻

OsMutation完全指南:如何快速将OpenVZ/LXC VPS重装为Debian/CentOS/Alpine系统

OsMutation完全指南:如何快速将OpenVZ/LXC VPS重装为Debian/CentOS/Alpine系统

OsMutation完全指南:如何快速将OpenVZ/LXC VPS重装为Debian/CentOS/Alpine系统 【免费下载链接】OsMutation Reinstall Any OpenVZ/LXC VPS to Debian/CentOS/Alpine 项目地址: https://gitcode.com/gh_mirrors/os/OsMutation OsMutation是一款强大的VPS系统…

2026/7/21 20:17:00 阅读更多 →
geoip完全指南:如何在Ruby中高效查询IP地理位置信息

geoip完全指南:如何在Ruby中高效查询IP地理位置信息

geoip完全指南:如何在Ruby中高效查询IP地理位置信息 【免费下载链接】geoip The Ruby gem for querying Maxmind.coms GeoIP database, which returns the geographic location of a server given its IP address 项目地址: https://gitcode.com/gh_mirrors/geo/g…

2026/7/21 20:17:00 阅读更多 →
总结归纳:C++17新特性

总结归纳:C++17新特性

关键字 constexpr 扩展constexpr使用范围&#xff0c;可用于if语句中&#xff0c;也可用于lambda表达式中。 #include<iostream>template<bool ok> constexpr void foo() {//在编译期进行判断&#xff0c;if和else语句不生成代码if constexpr (ok true){//当ok为t…

2026/7/21 20:17:00 阅读更多 →
解决ChatGLM微调显存不足问题:ChatGLM-finetune-LoRA的ZeRO优化策略终极指南

解决ChatGLM微调显存不足问题:ChatGLM-finetune-LoRA的ZeRO优化策略终极指南

解决ChatGLM微调显存不足问题&#xff1a;ChatGLM-finetune-LoRA的ZeRO优化策略终极指南 【免费下载链接】ChatGLM-finetune-LoRA 项目地址: https://gitcode.com/gh_mirrors/ch/ChatGLM-finetune-LoRA 核心关键词&#xff1a; ChatGLM微调、显存不足、ZeRO优化、LoRA微…

2026/7/21 20:17:00 阅读更多 →
为什么92%的政企项目悄悄弃用GPT-4?——国产大模型适配信创生态的5个硬核通关路径

为什么92%的政企项目悄悄弃用GPT-4?——国产大模型适配信创生态的5个硬核通关路径

更多请点击&#xff1a; https://kaifayun.com 第一章&#xff1a;为什么92%的政企项目悄悄弃用GPT-4&#xff1f; 在2023至2024年落地的217个省级政务平台、金融核心系统及央企数字化项目中&#xff0c;第三方审计报告显示&#xff1a;仅8%仍在生产环境调用GPT-4 API&#xf…

2026/7/21 20:17:00 阅读更多 →
React Native ECharts与原生图表库对比分析:何时选择WebView方案

React Native ECharts与原生图表库对比分析:何时选择WebView方案

React Native ECharts与原生图表库对比分析&#xff1a;何时选择WebView方案 【免费下载链接】react-native-echarts Echarts for react-native. The react-naitve chart. 项目地址: https://gitcode.com/gh_mirrors/re/react-native-echarts 在移动应用开发中&#xff…

2026/7/21 20:16:00 阅读更多 →

日新闻

Octane Render与C4D汉化版安装与优化指南

Octane Render与C4D汉化版安装与优化指南

1. Octane Render与C4D的黄金组合&#xff1a;为什么选择这个方案&#xff1f;在三维创作领域&#xff0c;渲染器的选择往往决定了作品的最终呈现质量和工作效率。作为Cinema 4D&#xff08;C4D&#xff09;用户&#xff0c;Octane Render的GPU加速特性与实时预览功能&#xff…

2026/7/21 0:00:19 阅读更多 →
GPMC接口设计:异步/同步模式与多路复用配置实战

GPMC接口设计:异步/同步模式与多路复用配置实战

1. GPMC接口设计&#xff1a;从硬件连接到软件配置的全局视角在嵌入式系统开发中&#xff0c;尤其是基于TI Sitara系列如AM263x这类高性能微控制器的项目里&#xff0c;外部存储器的扩展几乎是绕不开的一环。无论是存放大量非易失性代码的NOR Flash&#xff0c;还是作为高速数据…

2026/7/21 0:00:19 阅读更多 →
UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

1. 项目概述&#xff1a;UE5 GAS RPG被动技能的核心价值在UE5里用GAS&#xff08;Gameplay Ability System&#xff09;做RPG游戏&#xff0c;主动技能像是你手里的武器&#xff0c;按一下打一下&#xff0c;逻辑直接&#xff0c;反馈也快。但被动技能&#xff0c;它更像是你身…

2026/7/21 0:00:19 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中&#xff0c;我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源&#xff0c;还是配置文件、证书等&#xff0c;都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下&#xff0c;但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP&#xff08;轻量级目录访问协议&#xff09;作为企业级身份认证的黄金标准&#xff0c;已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时&#xff0c;发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击&#xff1a; https://intelliparadigm.com 第一章&#xff1a;AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”&#xff0c;而是以可解释、可审计、可迭代的方式&#xff0c;赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻