这项研究由上海人工智能实验室联合中国科学技术大学、浙江大学和上海交通大学共同完成于2026年7月发表论文编号为arXiv:2607.09657有兴趣深入了解的读者可通过该编号查询完整论文。你有没有想过当一台AI在学习物理课本时如果只给它看课本上的文字而把所有图表、公式排版、示意图统统扔掉它还能学得好吗多年来训练大型AI语言模型的标准做法恰恰就是这么干的——把一本本科学文献的PDF转换成纯文字然后喂给AI。这篇研究的出发点就是质疑这个几乎从未被人挑战过的默认假设。研究团队将他们的方法命名为视觉预训练Visual Pretraining简称VP与之对应的传统方法叫文字预训练Text Pretraining简称TP。他们的核心发现是在完全相同的文献素材上直接让AI看图学习比先把图转成文字再让AI读文字效果更好而且还更省资源。这听起来几乎像是一个反直觉的结论——毕竟AI语言模型不是一直都在处理文字吗但实验数据相当清晰地指向了同一个方向。一、科学论文里藏着文字无法还原的知识考虑这样一个场景你拿到一篇量子力学论文的PDF然后用软件把它转成纯文本。原本整齐排列、层次分明的数学公式可能变成了一串混乱的字符原本一目了然的能级跃迁示意图彻底消失了原本通过图表对比呈现的实验数据变成了零散的数字。这种转换是有代价的——而且代价不小。认知科学领域早就有研究指出人类在思考时不只依赖语言还大量依赖图形、空间布局和符号拓扑结构。一个物理学示意图的价值并不仅仅在于图旁边的文字说明而在于它所呈现的几何关系、因果箭头、变量之间的视觉关联。当你把这张图转换成文字时这些关系就像沙堡遇上海浪大部分都消失了。研究团队将这种现象称为文字化损失。科学论文中的视觉元素——公式的排版方式、表格的结构、图示的空间组织——本质上是对知识的另一种编码方式与文字编码是互补的而非冗余的。现有的AI训练流程却把这一整套互补编码直接丢弃了。与此同时机器学习领域近年出现了一个叫做柏拉图表征假说的理论大意是说不同的AI模型无论是处理文字的还是处理图像的它们内部对世界的表征方式最终会趋向于某种共同的底层结构。这个理论暗示图像和文字其实在描述同一个现实而从图像中学习理论上可以获得与从文字中学习互补的知识。视觉预训练正是在这个思路上迈出了实践的一步。二、同样的论文一个读文字一个看原图为了公平比较研究团队精心设计了一个同源对照实验。他们准备了一批科学PDF文献然后走两条路第一条路用MinerU2.5这款文档解析软件把PDF转成文字大约得到800亿个文字词元可以粗略理解为800亿个字然后用这些文字训练AI第二条路把完全相同的PDF页面直接渲染成图片过滤掉空白边距等无效区域只保留有实际内容的前景图块大约只得到200亿个视觉词元然后用这些图像内容训练AI。两条路使用完全相同的文献素材使用完全相同的基础AI模型作为起点使用完全相同的后续微调步骤唯一的区别就是一个AI学的是文字另一个AI学的是原始图像。这种精心设计的对照确保了实验结论的干净任何性能差异都只能归因于表征方式的不同而不是学习材料的不同。在训练过程中视觉预训练的具体机制是这样运作的冻结的视觉编码器可以理解为AI的眼睛在训练过程中不被修改把每一张文档图片转化为一系列视觉特征向量可以理解为对图像各个区域的数字描述。然后AI语言模型的主体通过一个叫做下一个视觉潜变量预测的任务来学习给定前面若干个图像区块的特征预测下一个图像区块的特征。这个任务的逻辑与语言模型预测下一个词的逻辑完全一致只不过预测的对象从离散的文字变成了连续的视觉特征向量。具体的损失函数采用了一种叫做InfoNCE的对比学习目标在一批预测结果中每个预测都要与它对应的真实下一个视觉特征尽量靠近同时与批次中其他无关的视觉特征尽量远离。这就像一道选择题AI不只要说出正确答案还要同时否定所有干扰选项。整个训练过程中语言模型主体、视觉投影模块和预测头都在更新而视觉编码器始终保持冻结为AI提供稳定的视觉特征靶标。训练时文字学习和视觉学习是交织进行的最终的损失函数是两者的加权和两个权重都可以调整相当于在说同时从文字和图像中学习各自占一定比重。三、实验结果视觉预训练在四款顶级AI上全面领先研究团队在四款当前最先进的大型AI模型上进行了测试覆盖了两类架构原生多模态模型Qwen3.5和Llama 3.2 Vision本身就能处理图像和纯语言模型Qwen3和Llama 3.1本身只处理文字。测试的评测基准涵盖了四个方向MMLU-Pro考察跨学科知识广度、GPQA Diamond研究生级别的科学推理号称谷歌防作弊问答、AIME 2025美国数学邀请赛考察高难度数学推理和HLE人类最后考试考察极端困难的多步骤推理。所有测试都以文字形式进行也就是说最终评测时AI读的是文字题目输出的是文字答案。这一点非常关键视觉预训练提升的是AI的语言推理能力而不只是让AI更善于理解图片。结果显示在Qwen3.5这款多模态模型上视觉预训练相比文字预训练GPQA Diamond提升了3.05个百分点从76.24到79.29MMLU-Pro提升了1.18个百分点从83.91到85.09AIME提升了0.63分从89.58到90.21HLE提升了0.97个百分点从15.70到16.67。在Llama 3.2 Vision上GPQA提升了2.84个百分点从30.24到33.08AIME提升了4.79分从13.75到18.54提升幅度尤为显著。在两款纯语言模型上同样呈现了一致的提升趋势Qwen3的GPQA从74.94提升到77.08Llama 3.1的GPQA从43.88提升到47.10。HLE这个基准的提升幅度相对最小研究团队对此给出了合理解释HLE的难度主要来自极端复杂的多步骤推理而不是依赖科学文献中的视觉知识。换句话说视觉预训练主要帮助AI获取那些被文字转换丢失的知识而不是凭空增强推理深度。四、只用四分之一的词元效果却更好除了性能提升研究团队还发现了一个令人意外的效率优势。回忆一下前面说的文字预训练用了约800亿个词元视觉预训练只用了约200亿个词元后者的词元用量仅为前者的四分之一。尽管如此视觉预训练的性能却全面超越了文字预训练。这种效率差异从哪里来核心原因在于科学文档的视觉表示本身就是一种高度压缩的信息编码。一张展示实验结果的图表可能只占几百个视觉图块但如果要把图表中的所有信息完整地用文字表达出来需要几段乃至几页文字。视觉预训练直接对这种高密度编码的原始形式进行学习不需要先把信息解压成文字再学习节省了大量词元预算。研究团队还做了更细致的消融实验探究视觉词元数量和图像渲染分辨率对性能的影响。在视觉词元数量方面他们测试了从0.25倍到4倍的预算范围发现1倍设置每批次保留8192个前景视觉词元是性能最优的甜蜜点。过多的视觉词元反而会因为对比学习中批次内负样本数量增加、有效梯度尺度改变等优化层面的原因导致性能略微下降。在图像分辨率方面他们发现即使把最大分辨率从1120降低到560性能损失也非常有限视觉预训练在低分辨率下仍然明显优于文字预训练。这进一步说明视觉预训练的优势来自对文档结构的整体理解而非对像素细节的死记硬背。研究团队还绘制了性能随训练词元数量增加的变化曲线发现视觉预训练的收益增长速度明显快于文字预训练。具体而言以文字预训练相对基线的提升为参照视觉预训练在MMLU-Pro上达到了1.27倍的归一化增益在GPQA上达到2.02倍在AIME上达到2.88倍。也就是说用更少的词元获得了更陡的学习曲线这在AI训练中是相当罕见的特质。五、结构越密集视觉预训练越占优势研究团队还做了一项颇有洞察力的分析按照文档页面的视觉结构密度对评测样例进行分类然后分别统计不同密度下视觉预训练相对文字预训练的优势大小。视觉结构密度简单来说就是一个页面上有多少公式、图表、示意图等非纯文字内容依照Masry等人的方法划分为低、中、高三个层级。结果非常直观在低密度基本上是纯文字页面的样例上视觉预训练和文字预训练的性能几乎持平差值约为-0.15可以忽略不计。在中密度样例上视觉预训练领先约2.86分。在高密度样例充满公式、图表、示意图上视觉预训练领先高达3.80分。这个规律完美印证了研究的核心逻辑文字转换过程中丢失的正是那些在视觉上有意义的结构——方程式的拓扑排列、表格的行列关系、图示中的方向性箭头。这些东西越多文字化的损失就越大视觉预训练的优势就越明显。低密度页面由于本来就以文字为主文字转换几乎没有损失两种预训练方式自然不分伯仲。此外研究团队还发现视觉特征预测的质量与下游任务的提升幅度之间存在明确的正相关AI在预测下一个视觉图块特征时越准确用余弦相似度衡量最终在多模态评测基准上的性能提升也越大。这种联系说明视觉空间的建模质量是视觉预训练能够发挥作用的根本原因而不是某种难以解释的随机现象。六、没有图文配对标注多模态能力也自然涌现视觉预训练还带来了一个额外的惊喜在完全没有使用任何图文配对标注数据的情况下AI处理多模态任务的能力也提升了。这意味着视觉预训练的好处不仅仅停留在语言推理层面还会渗透到AI理解图像内容的能力中。研究团队从Qwen3.5模型中提取了100对科学文档的图像-文字配对样本的内部表示然后用多种指标衡量视觉表示和文字表示之间的相容性也就是说当AI处理同一篇文档的图像版本和文字版本时它内部对这两个版本的理解有多接近。结果显示经过视觉预训练之后全局层面的质心分离度两种模态的平均表示之间的距离从1.665骤降至0.661降幅接近60%配对样本的余弦相似度同一文档的图像表示和文字表示有多相似从0.631上升到0.907。结构层面线性CKA衡量两种表示的几何结构是否相似从0.657上升到0.745。局部层面互相最近邻重叠度同一文档的图像和文字在各自的邻居圈子里有多少重合在所有测试的k值下都显著提升在最严格的k1设置下从0.140提升到0.310翻了一倍有余。这些数字共同描绘了一幅清晰的图景视觉预训练重塑了AI内部的表示空间让图像和文字的理解在某种共同的内部语言中更好地对齐了。在多模态基准测试上视觉预训练同样全面领先。以Qwen3.5为例MMMU-Pro多学科多模态理解从基线72.14文字预训练提升到73.87SFE科学家首次考试从53.09提升到56.57ChartQAPro图表问答从56.42提升到61.80MathVista视觉数学推理从85.50提升到86.70。文字预训练在ChartQAPro上甚至出现了相对基线的退步从57.99降到56.42说明进一步的文字训练反而无助于、甚至损害了对视觉密集型任务的处理能力而视觉预训练则恰恰在这类任务上优势最为突出。研究团队还额外做了一项图像到文字检索的测试给定一张文档图片让AI在100篇文档文字中找出对应的那一篇。文字预训练模型的R1准确率找到正确文档的概率为64%而视觉预训练模型的准确率跃升至99%。原来那种AI常见的某些文字被当作万能答案的枢纽现象少数几篇文字不论输入什么图像都容易被选中因为它们的内部表示太中庸所以与很多输入都距离不远在视觉预训练后几乎消失了说明AI内部的图文对应关系变得更加精确和有区分度。七、AI注意力揭示的视觉推理机制研究团队还做了一个定性分析试图理解视觉预训练为何能帮助AI做数学题。他们取了同一道数学题分别以纯文字形式和图像形式输入到Qwen3.5然后提取AI在生成最终答案时对前面内容的注意力分布——也就是说AI在写出答案的那一刻最关注的是哪些部分。在文字模式下AI对原题的约束条件和中间计算步骤给予了高度关注而对填充性文字几乎不理会。在视觉模式下AI的注意力集中在图像中对应这些语义区域的位置——同样是约束条件和中间计算步骤所在的区域而非无关区域。两种模态的注意力模式呈现出相当程度的对应关系说明视觉预训练让AI学会了从文档图像中识别和关注推理所需的关键证据与纯文字推理时使用的证据在语义层面是对齐的。研究团队谨慎地指出这个分析只是支持性证据不能据此得出文字推理和视觉推理在内部使用完全相同机制的结论。但它至少说明视觉预训练确实让AI在处理视觉文档时能够把注意力引导到语义上有意义的位置。八、是否需要像素级重建答案是不必要研究团队还探索了一种更强的视觉预训练变体给AI加装一个生成式解码器不只预测视觉特征向量还要把文档图像的像素完整地重建出来从而获得像素级别的监督信号。这个变体的逻辑很有吸引力——像素级监督更细致理论上应该让AI学到更多细节。然而结果却出乎意料地让人冷静加装了生成式解码器的版本在语言推理评测基准上的性能与不带解码器的简洁版本基本持平甚至在部分指标上略逊。而代价是训练成本上升了约30%到40%整个训练管线也复杂得多需要额外约3亿参数的解码器以及额外的扩散风格潜变量损失和像素级MSE损失。带解码器的版本达到相同收敛标准需要约1.4倍的训练时间。这个结论说明对于下游语言推理任务而言像素级的重建精度并不是AI需要从文档中学习的关键。AI需要的是文档的结构和语义而这些在视觉特征向量层面就已经被充分捕获了无需下沉到像素层面。这反过来也证明了简洁版视觉预训练的设计是合理的。归根结底这项研究讲的是一件相当反常识的事当AI学习科学知识时直接看原始文档图片比读从图片里提取出来的文字学得更好用的字数还更少。这个发现挑战的是整个AI大模型训练领域多年来一个几乎没人认真质疑过的默认做法——把所有文献都转成文字再学习。对普通人来说这项研究最直接的意义或许是未来的AI在回答物理、化学、数学等科学问题时可能会因为在训练时见过而非读过相关文献而给出更准确的答案。一个AI如果在学习过程中真正理解了一张物理示意图的空间结构而不只是读了对这张图的文字描述它在面对类似问题时的表现理应更好——而这项研究的实验结果正是对这个直觉的系统性验证。当然研究团队也坦诚了几个局限。视觉预训练并非独立于语言预训练它是在语言预训练基础上的补充延伸而非替代。研究主要针对科学文献这类知识密度极高、图文紧密耦合的文档类型是否对自然照片、视频等更广泛的视觉内容同样有效目前还不清楚。此外视觉预测损失和文字损失之间的协调调度方式也还有很大的探索空间。这些都留给了未来的研究去回答。QAQ1视觉预训练和传统文字预训练的根本区别是什么A传统文字预训练会先用工具把PDF文献转成纯文本再用这些文字训练AI这个过程会丢失公式排版、图表结构、示意图的几何关系等视觉信息。视觉预训练则直接把PDF页面渲染成图片过滤掉空白边距后让AI通过预测下一个图像区块的视觉特征来学习从而保留了文字化过程中会丢失的结构性知识。两者使用完全相同的文献素材差别只在于信息的呈现形式。Q2视觉预训练为什么能提升AI回答文字问题的能力A科学文献中的很多知识本来就是通过视觉形式编码的——公式的拓扑结构、图表的因果关系、示意图的空间组织。当这些内容被转成文字时这些关系大部分会丢失。视觉预训练让AI直接从原始图像中学习这些结构性知识相当于获取了文字化路径无法传递的信息。实验证明在科学推理评测中视觉结构越密集的题目视觉预训练的优势越明显这直接支持了是视觉结构知识起了作用这一解释。Q3视觉预训练需要图文配对的标注数据吗A不需要。视觉预训练完全是无监督的训练过程中AI只看未加任何标注的原始文档图像没有人工标记的图文对应关系也没有描述图像内容的文字标签。尽管如此经过视觉预训练后AI处理多模态任务如图表问答、视觉数学推理的能力也显著提升说明无监督的视觉学习自然地改善了AI内部图像与文字表示的对齐程度。