ULIP-2总结
前言ULIP-2: Towards Scalable Multimodal Pre-training for 3D UnderstandingSalesforce AI Research 等CVPR 2024研究的是如何让 3D 点云表征学习到大规模图文预训练模型如 CLIP的开放语义从而具备 zero-shot / 开放词表能力。研究背景与动机3D 理解长期受限于标注数据稀缺与类别封闭——每换一个任务就要重新采集并标注点云成本极高。随着 CLIP 等视觉-语言模型在开放词汇识别上展现出强大泛化一个自然的想法是把 3D 表征对齐到 CLIP 已对齐的图文空间让 3D 模型借用图文模型的开放语义免去逐任务标注。当前现状这一方向已形成「冻结大模型 训练轻量 3D 编码器」的主流范式——PointCLIP 通过点云投影成深度图复用 CLIP 视觉编码器「绕道」获取语义ULIP 则更彻底冻结 CLIP 当「老师」、直接训练 3D 编码器对齐到图文空间在 zero-shot 3D 分类上大幅领先。但这类方法的语言模态普遍来自 CAD 模型 metadata 套 prompt 模板的短描述本质是人工标注。本文旨在解决的问题ULIP 式对齐存在一个被掩盖的数据瓶颈其语言模态有三大核心 gap不可扩展依赖数据集自带的类别 metadata面对无标注的大规模 3D 数据如 Objaverse 真实扫描寸步难行描述单一模板生成的句子千篇一律缺少对物体形态、材质、部件、功能的全面holistic语义质量有噪metadata 常有缺漏或错误且单个模板表达不稳定。ULIP-2 给出了回答用大模型 BLIP-2 对多视角渲染图自动生成 holistic 语言描述仅需 3D 数据本身全程零人工标注因此可扩展到任意大规模 3D 数据集同时把视觉-语言 backbone 放大到 OpenCLIP ViT-G。它在 Objaverse-LVIS zero-shot 分类上达到50.6%top-1比当前 SOTA OpenShape 高3.8%ModelNet40 zero-shot84.7%ScanObjectNN 微调91.5%仅1.4M参数。Figure 1. ULIP-2 预训练框架与下游任务总览。3D 物体经多视角渲染后由 BLIP-2 生成语言描述与 3D 点云、2D 渲染图组成可扩展三元组再通过对齐损失将 3D 编码器拉入 OpenCLIP 已对齐的图文空间并支持 zero-shot 分类、标准分类与 3D 描述生成三类下游任务。流程图分析Figure 2. 可扩展三元组构建流程。给定 3D 物体先多视角渲染 2D 图像再由 BLIP-2 为每张图独立生成 10 条描述用 CLIP 图文相似度排序后取 top-1 作为该物体的语言模态与点云、渲染图组成三元组——全程仅需 3D 数据零人工标注。整条流水线可以拆成三块来理解可扩展三元组构建3D 物体 → 表面采样点云 多视角渲染图 BLIP-2 生成的 holistic 描述CLIP 排序取 top-1。只有点云和渲染图参与训练描述完全自动生成因此可扩展到任意无标注 3D 数据集三模态特征提取OpenCLIP ViT-G 的图像/文本编码器全程冻结仅 3D 编码器可训练三模态特征通过对比损失对齐到 OpenCLIP 已对齐的图文空间对比对齐 下游适配P2I P2T 两个对比损失把 3D 表征拉向图文空间下游支持 zero-shot 3D 分类、标准 3D 分类微调、3D 描述生成接 LLM。关键姿态OpenCLIP 的图像与文本编码器全程冻结整个预训练只更新 3D 编码器参数。这与 ULIP 同一哲学但把「老师」从 SLIP ViT-B 放大到 OpenCLIP ViT-G——既规避了图文空间被小数据破坏的风险又让 3D 表征对齐到更强的语义空间。各模块功能对应总结模块作用是否可训练① 可扩展三元组构建3D 物体多视角渲染 BLIP-2 生成 10 条描述 CLIP 排序取 top-1全程零人工标注否数据预处理② 3D 点云提取从 3D 表面均匀采样点云Objaverse 12 视角 / ShapeNet 30 视角按下游任务取 2k/8k/10k 点否数据预处理③ 3D 点云编码器Point-BERT / PointNeXt 任选提取 3D 表征fP\mathbf{f}^{\mathrm{P}}fP是唯一训练对象④ OpenCLIP 图像编码器ViT-G提取渲染图特征fI\mathbf{f}^{\mathrm{I}}fI提供视觉语义监督冻结⑤ OpenCLIP 文本编码器ViT-G提取 BLIP-2 描述特征fT\mathbf{f}^{\mathrm{T}}fT冻结⑥ 跨模态对比损失P2I P2T 双向对称 InfoNCE 可学习温度τ\tauτ仅对齐 3D↔I 与 3D↔T损失函数无参数流程解析步骤 1可扩展三元组构建全自动、零人工标注ULIP-2 只需 3D 物体本身无需任何 metadata点云PPP从 3D 表面均匀采样Objaverse 渲染 12 视角取点ShapeNet 沿用 30 视角按任务取 2k/8k/10k 点渲染图III用 Blender 等距渲染多视角 2D 图像Objaverse 12 张 / ShapeNet 30 张 RGB 深度图语言TTT每张渲染图经 BLIP-2-opt6.7B 独立生成10 条详细描述再用 CLIP-ViT-Large 图文相似度排序取 top-1作为该物体的语言模态消融 Table 8 证明 top-1 最抗噪、效果最好。步骤 2三模态特征提取对应公式特征定义三个编码器分别提取各自模态特征特征空间已由 OpenCLIP 预对齐图像fIEI(I)\mathbf{f}^{\mathrm{I}} E_{\mathrm{I}}(\mathbf{I})fIEI​(I)EIE_{\mathrm{I}}EI​是冻结的 OpenCLIP ViT-G 图像编码器文本fTET(T)\mathbf{f}^{\mathrm{T}} E_{\mathrm{T}}(\mathbf{T})fTET​(T)ETE_{\mathrm{T}}ET​是冻结的 OpenCLIP ViT-G 文本编码器3DfPEP(P)\mathbf{f}^{\mathrm{P}} E_{\mathrm{P}}(\mathbf{P})fPEP​(P)EPE_{\mathrm{P}}EP​是可训练的 3D backbonePoint-BERT / PointNeXt。步骤 33D↔图像对比对齐对应公式 1用双向对称 InfoNCE 把 3D 特征拉向图像特征正样本对同物体的 3D-图像拉近负样本对跨物体推远温度τ\tauτ可学习。步骤 43D↔文本对比对齐 总目标对应公式 2、3同样用双向对称 InfoNCE 对齐 3D 与文本最终目标只优化 3D 编码器使 P2I P2T 两个损失之和最小公式 3。关键图像-文本对齐由 OpenCLIP 预先固定不更新因此只存在 2 个损失而非 ULIP 的 3 对对齐。步骤 5下游任务zero-shot 3D 分类直接计算 3D 特征与候选类别文本特征距离最小者胜无需微调标准 3D 分类用预训练 3D 编码器初始化在 ScanObjectNN / ModelNet40 微调3D 描述生成把预训练 3D 编码器接入冻结 LLM 的 X-InstructBLIP 框架实现 3D→language 生成。创新点分析1. 全自动可扩展三元组范式核心贡献ULIP-2 最根本的创新是把语言模态的来源从人工标注 metadata换成大模型自动生成。ULIP 依赖 CAD 模型的类别名套 prompt 模板本质上仍需人工标注且描述单一ULIP-2 只需 3D 物体本身由 BLIP-2 生成 holistic 多视角描述因此能扩展到 Objaverse 这类无标注的真实大规模 3D 数据。消融 Table 5 证明仅把语言模态从 manual 换成 BLIP-2 top-1ModelNet40 zero-shot 就从60.4% → 69.7%top-1——数据质量的提升立竿见影。2. 大模型知识蒸馏进语言模态BLIP-2 在海量图文对上预训练其生成的描述浓缩了大规模图文知识比模板句子语义更丰富涵盖形态、材质、功能、部件关系。论文指出这些描述encapsulate knowledge from a vast amount of language and image data直接丰富了 3D 形状描述的语义密度从而强化语言-3D 对齐。Table 6 进一步显示BLIP-269.7%优于更早的 BLIP67.7%说明多模态模型越强ULIP-2 越好——方法随大模型进步而增益。3. 多视角聚合 信息完整性ULIP-2 为每个 3D 物体渲染多视角图像并分别生成描述用视角多样性换取语义完整性。Figure 2 展示了这一机制消融 Table 7 显示视角数从 1 增至 30ModelNet40 top-1 从54.8% → 69.7%证明多样的 holistic 视角描述显著裨益 3D 表征学习。这呼应了 ULIP 用多视角渲染但 ULIP-2 把「视角」升级为「视角 自动描述」。4. 极简框架 backbone scaling 仍超 SOTAULIP-2 框架比 ULIP 更简单仅 2 个对齐损失、不更新图文空间却因更强 backbone 与更好数据全面超越基线Objaverse-LVIS zero-shot50.6%比当前 SOTA OpenShape46.8%高3.8%且用的预训练数据集更少Table 1。Table 9 显示放大 OpenCLIP 到 ViT-G 后 Objaverse-LVIS 从 28.3%→35.0%3D 编码器在 ~32.5M 参数处饱和——简单框架 放大 teacher 即登顶。重要公式分析ULIP-2 的 3 个公式刻画了「特征提取 → 双向对比对齐 → 优化」的完整逻辑链。与 ULIP 的 3 对对齐I-S / I-P / P-S不同ULIP-2只对齐3D → 已冻结的 I 与 T因此只有 2 个损失图文对齐由 OpenCLIP 预先固定。公式 (1)3D↔图像对比损失P2ILP2I−12∑ilog⁡exp⁡(fiPfiI/τ)∑jexp⁡(fiPfjI/τ)log⁡exp⁡(fiPfiI/τ)∑jexp⁡(fjPfiI/τ),(1)\mathcal{L}_{\mathrm{P2I}} - \frac{1}{2} \sum_{i} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{j}^{\mathrm{I}} / \tau)} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{j}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)},\tag{1}LP2I​−21​i∑​log∑j​exp(fiP​fjI​/τ)exp(fiP​fiI​/τ)​log∑j​exp(fjP​fiI​/τ)exp(fiP​fiI​/τ)​,(1)其中i,ji,ji,j为 batch 内采样索引τ\tauτ为可学习温度。双向对称第一项是「以 3D 为锚点」拉开与其他图像的距离第二项「以图像为锚点」拉开与其他 3D 的距离——保证两模态互相对齐而非单向依赖。公式 (2)3D↔文本对比损失P2TLP2T−12∑ilog⁡exp⁡(fiPfiT/τ)∑jexp⁡(fiPfjT/τ)log⁡exp⁡(fiPfiT/τ)∑jexp⁡(fjPfiT/τ).(2)\mathcal{L}_{\mathrm{P2T}} - \frac{1}{2} \sum_{i} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{T}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf f_{j}^{\mathrm{T}} / \tau)} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf f_{i}^{\mathrm{T}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{j}^{\mathrm{P}} \mathbf f_{i}^{\mathrm{T}} / \tau)}.\tag{2}LP2T​−21​i∑​log∑j​exp(fiP​fjT​/τ)exp(fiP​fiT​/τ)​log∑j​exp(fjP​fiT​/τ)exp(fiP​fiT​/τ)​.(2)结构与 P2I 完全对称只是把图像特征换成文本特征。两个损失共用同一温度τ\tauτ。公式 (3)总训练目标关键设计min⁡EPLP2ILP2T.(3)\min_{E_{\mathrm{P}}} \mathcal{L}_{\mathrm{P2I}} \mathcal{L}_{\mathrm{P2T}}.\tag{3}EP​min​LP2I​LP2T​.(3)最终只优化 3D 编码器EPE_{\mathrm{P}}EP​。关键设计只优化 3D 编码器图像/文本编码器冻结图文对齐空间不被小数据破坏规避 ULIP 中α0\alpha0α0防灾难性遗忘的同一考量但这里更彻底——根本不计算 I-T 对齐损失仅 2 个损失相比 ULIP 的 3 对 6 项对比ULIP-2 只用 P2I P2T框架更简洁、训练更稳定实际效果3D 编码器被单向「拉」入 OpenCLIP 已对齐的图文空间老师ViT-G不动学生3D 编码器靠拢。论文总结贡献回顾全自动可扩展的 3D 多模态预训练仅用 3D 数据 BLIP-2 自动生成描述消除人工标注瓶颈可扩展到 Objaverse 等大规模真实 3D 数据大模型 holistic 描述显著提升对齐质量BLIP-2 浓缩的图文知识让语言-3D 对齐更紧同数据下比 ULIP 高13.8%~24.9%Objaverse-LVIS top-1极简框架 放大 backbone 登顶 SOTAObjaverse-LVIS zero-shot50.6%3.8% over OpenShapeScanObjectNN91.5%仅 1.4M 参数发布 ULIP-Objaverse / ULIP-ShapeNet 三元组数据集并拓展 3D→language 生成新下游CIDEr28.3%。实验结果精华实验关键数字含义Objaverse-LVIS zero-shotULIP-250.6%vs OpenShape 46.8%3.8最简框架超当前 SOTA且用更少预训练数据ModelNet40 zero-shot84.7%top-1开放词表分类强ScanObjectNN 微调PointNeXt91.5%1.4M参数轻量模型刷新记录3D captioning (CIDEr)ULIP 132.2 → ULIP-2160.528.33D→language 生成能力显著增强同数据 vs ULIPObjaverse-LVIS 13.8~24.9%top-1描述质量 scaling 的增益来源Figure 3. 基于 X-InstructBLIP 的 3D-to-language 多模态生成。ULIP-2 预训练的 3D 编码器接入冻结 LLM 后能为 3D 形状生成更准确、更细致的语言描述。与前序论文关联ULIP治「如何对齐空间」→ ULIP-2 治「如何造可扩展数据」前者是治标借 SLIP 对齐框架 模板描述后者是治本用大模型自动造 holistic 描述破解数据瓶颈ULIPmetadata prompt 模板描述需人工标注描述单一ULIP-2BLIP-2 自动生成 holistic 描述零人工标注可扩展PointCLIP更遥远的「绕道」——把点云投影成深度图复用 CLIP3D 表征未学到语义ULIP/ULIP-2 是「直道」对齐且 ULIP-2 把直道的数据供给自动化PointNet / PointNet / Point-BERT / PointNeXt3D 编码器底座继承——ULIP-2 直接用 Point-BERT / PointNeXt 当 backbone验证「冻结大模型 训轻量 3D 编码器」范式的通用性演进逻辑从「借 2D 模型」(PointCLIP) →「对齐到 2D 空间」(ULIP) →「自动化造数据喂养对齐」(ULIP-2)一步步把 3D 多模态从巧思走向可工业级扩展。

相关新闻

面试说话总是没有很好的逻辑性

面试说话总是没有很好的逻辑性

总是会有很多重复的连接,比如“然后 就是 ” 我感觉本质上是因为脑子转不过弯来 已经到怀疑自己智商的程度。 以至于非常惧怕面试,惧怕需要面试的一切。我也是这样的~我超级害怕面试我是一个超级大i人。我第一次第二次面试前超级焦虑面试的时…

2026/7/19 22:23:53 阅读更多 →
社区贡献指南:如何为ESP8266 FastLED WebServer项目提交代码和文档

社区贡献指南:如何为ESP8266 FastLED WebServer项目提交代码和文档

社区贡献指南:如何为ESP8266 FastLED WebServer项目提交代码和文档 【免费下载链接】esp8266-fastled-webserver 项目地址: https://gitcode.com/gh_mirrors/es/esp8266-fastled-webserver ESP8266 FastLED WebServer是一个基于ESP8266开发板的开源项目&…

2026/7/19 22:22:52 阅读更多 →
终极指南:SideJITServer为iOS 17+设备开启无线JIT编译的完整解决方案

终极指南:SideJITServer为iOS 17+设备开启无线JIT编译的完整解决方案

终极指南:SideJITServer为iOS 17设备开启无线JIT编译的完整解决方案 【免费下载链接】SideJITServer A JIT enabler for iOS 17 with a Windows/macOS computer on the same WiFi! 项目地址: https://gitcode.com/gh_mirrors/si/SideJITServer 在iOS 17及更高…

2026/7/19 22:22:52 阅读更多 →

最新新闻

Sentinel限流熔断在Spring Boot中的实战应用

Sentinel限流熔断在Spring Boot中的实战应用

1. 为什么我们需要Sentinel这样的限流熔断工具?去年双十一大促期间,我负责的一个电商系统在流量高峰时突然崩溃,当时每秒请求量达到了平日的20倍。数据库连接池耗尽、服务间调用雪崩、核心接口响应时间从200ms飙升到15秒...这场事故让我深刻认…

2026/7/20 11:58:47 阅读更多 →
2026企业AI办公工具横评:Kimi Work主流替代产品选型指南

2026企业AI办公工具横评:Kimi Work主流替代产品选型指南

最近调研了面向企业场景的多款主流AI办公Agent工具,覆盖日常协作、内容生产、业务流程对接等核心需求,最终选择了飞书 aily,核心原因是它原生适配国内团队常用的飞书协作体系,AI生成的所有内容都可以直接沉淀到团队现有工作链路中…

2026/7/20 11:58:47 阅读更多 →
5分钟极简教程:如何将任何网站转换为可编辑的Figma设计稿

5分钟极简教程:如何将任何网站转换为可编辑的Figma设计稿

5分钟极简教程:如何将任何网站转换为可编辑的Figma设计稿 【免费下载链接】figma-html Convert any website to editable Figma designs 项目地址: https://gitcode.com/gh_mirrors/fi/figma-html 你是否曾想过,能否像复制粘贴一样简单地将网页变…

2026/7/20 11:58:47 阅读更多 →
办公室久坐危害与微运动解决方案

办公室久坐危害与微运动解决方案

1. 久坐危害的全面解析 作为一名在办公室工作了12年的职场老鸟,我深刻体会过久坐带来的各种身体困扰。从最初的腰酸背痛,到后来体检报告上亮起的各种红灯,这些都在提醒我:久坐真的会要命。 现代医学研究已经证实,连续…

2026/7/20 11:58:47 阅读更多 →
傅山这幅大字行草,到底厉害在哪?

傅山这幅大字行草,到底厉害在哪?

朋友们,今天咱们不绕弯子,直接看东西。你见过那种挂在博物馆里,远远一看就镇住全场的字吗?对,就是那种——不用懂书法,也能感觉到“有东西”的作品。傅山这幅《行草足梦中句七言诗》就是这么个玩意儿。它现…

2026/7/20 11:58:47 阅读更多 →
一文读懂:2025年可穿戴健康预警设备榜单有哪些值得关注的产品?

一文读懂:2025年可穿戴健康预警设备榜单有哪些值得关注的产品?

在现代社会,可穿戴健康预警设备越来越受到人们的关注。随着生活节奏的加快,心脑血管疾病等健康问题愈发凸显。根据国家卫健委统计数据显示,心脑血管疾病死亡占居民总死亡比例已超80%,且发病呈年轻化趋势。多数患者在发作前无典型症…

2026/7/20 11:57:47 阅读更多 →

日新闻

2026 WAIC:努比亚二代“豆包手机”NaviX Ultra亮相,智能体验全面升级!

2026 WAIC:努比亚二代“豆包手机”NaviX Ultra亮相,智能体验全面升级!

7月18日智东西消息,在2026 WAIC期间,努比亚联合字节豆包打造的二代“豆包手机”努比亚NaviX Ultra首次亮相,相比一代有诸多升级。智能体手机理念中兴通讯终端事业部总裁、努比亚总裁倪飞表示,智能体手机要从人操作手机变为手机帮人…

2026/7/20 0:00:34 阅读更多 →
努比亚NaviX Ultra亮相WAIC,智能体手机能否让用户生活更简单?

努比亚NaviX Ultra亮相WAIC,智能体手机能否让用户生活更简单?

努比亚NaviX Ultra:外观与功能双升级在2026 WAIC期间,首次亮相的努比亚NaviX Ultra吸引了众多目光。它是努比亚联合字节豆包打造的二代“豆包手机”,与一代努比亚M153相比,外观设计变化较大。其机身背部搭载横向排布的大尺寸影像模…

2026/7/20 0:00:34 阅读更多 →
C# 将逗号分割的字符串转换为long,并添加到List<long>

C# 将逗号分割的字符串转换为long,并添加到List<long>

目录 方法1:使用Split和Convert.ToInt64 方法2:使用LINQ的Select和ToList 方法3:使用TryParse进行异常安全转换(推荐) 如果您喜欢此文章,请收藏、点赞、评论,谢谢,祝您快乐每一天…

2026/7/20 0:00:34 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/20 5:57:49 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/20 4:31:26 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/20 5:56:42 阅读更多 →

月新闻