当人眼分辨AI作品开始失效我在线体验了合合信息 AI 跨模态鉴伪图片、视频、文本如何被高效识别过去我们判断一张图片是不是真的往往会放大观察人物的手指、文字边缘和光影方向判断一段视频是否经过伪造会留意口型、表情以及声音是否自然判断一篇文章是不是 AI 写的则可能依据措辞是否模板化、句式是否过于工整。但这些经验正在迅速失效。生成式 AI 已经不再局限于生成一张带有明显错误的图片。它可以修改支付截图中的金额替换照片中的局部对象生成口型自然的人物视频也可以将机器生成的文本改写成更接近个人表达习惯的版本。更麻烦的是这些内容往往还会经过截图、压缩、裁剪、转码和二次编辑进一步抹去原始生成痕迹。在这种情况下仅凭人眼寻找“六根手指”或者语句中的“AI 味”很难继续承担内容真实性判断的任务。2026年世界人工智能大会期间合合信息升级了 AI 跨模态鉴伪技术将鉴别范围从此前的图像和人脸视频拓展至图片、视频、文本等主要信息介质并面向社交聊天、图文资讯、电商交易、短视频分享和学术研究等场景提供鉴别能力。这次我将从一个线上技术体验者的角度重点关注三个问题所谓“跨模态鉴伪”是不是把不同内容统一交给一个模型判断图片、视频和文本分别可以留下哪些机器可识别的证据鉴伪系统真正适合承担什么角色能不能把结果直接理解成最终结论文章目录当人眼分辨AI作品开始失效我在线体验了合合信息 AI 跨模态鉴伪图片、视频、文本如何被高效识别一、先说体验感受有价值的不只是“真”或“假”二、“跨模态”并不意味着所有内容都走同一条检测路径三、图片鉴伪既要看画面表达也要看像素背后的生成痕迹1. 高层语义特征2. 底层视觉特征3. 实测**扫描全能王AI鉴伪小程序**图片鉴伪能力四、视频鉴伪单帧看不出的问题可能会在时间轴上暴露五、文本鉴伪统计“AI味”已经不够需要进入语义和逻辑层六、线上“AI较真大赛”最有意思的地方它暴露了人类判断的不稳定七、真正的产品价值不是代替人下结论而是承担规模化初筛八、也要理性看待鉴伪不是一劳永逸的“终局技术”结语从“我觉得是真的”转向可验证的内容可信机制一、先说体验感受有价值的不只是“真”或“假”合合信息提供的线上扫描全能王AI鉴伪小程序支持上传多种类型的素材包括 AI 生成图片、真实照片、经过编辑或合成的图片以及视频和文本。检测完成后页面会展示鉴别结论及相应的置信度。按照投放材料中的要求这次体验的重点也并非单独测试某一种图片而是观察系统是否具备跨图片、视频和文本的检测能力。这里有一个容易被忽略的细节相比简单地显示“真”或“假”置信度实际上更重要。现实中的内容鉴伪很少是边界清晰的二分类问题。一张图片可能是相机拍摄的但其中一小块区域被 AI 修改一段视频可能主体真实但背景、口型或音轨经过生成式编辑一篇文本可能由人类写出初稿再经过大模型润色。因此“这份内容是不是完全由 AI 生成”与“这份内容中是否存在生成或篡改痕迹”本身就是两个不同的问题。从实际使用角度看置信度可以被理解为一种风险信号低风险内容可以继续进入正常业务流程中等风险内容可以结合来源、元数据和上下文进一步检查高风险内容则可以进入人工审核或专业取证流程。这比把检测器当成一台只会输出“真”“假”的机器更合理。本文我将通过实际测试来帮助我们观察系统究竟是在记忆某个模型的固定“指纹”还是能够从更广泛的语义、频谱、噪声、时序和结构特征中发现异常。二、“跨模态”并不意味着所有内容都走同一条检测路径“跨模态鉴伪”很容易让人联想到一个巨大的统一模型无论用户提交图片、视频还是文字都直接送入同一个神经网络。但从合合信息公开的技术介绍来看更准确的理解是系统围绕图片、视频和文本建立了差异化的检测路径再通过统一的产品入口和可信鉴别体系向用户提供服务。这是一个重要区别。因为不同信息介质中的伪造证据并不相同内容类型可能存在的鉴伪线索图片频谱伪影、噪声异常、纹理不连续、语义矛盾、局部编辑痕迹视频帧间抖动、运动轨迹异常、时序不一致、时空频域伪影文本语义连贯模式、句法微小畸变、高概率表达、逻辑结构异常如果强行使用完全相同的特征空间处理三种介质反而可能损失各自最关键的取证信息。因此这套技术的核心价值不只是“支持三种文件格式”而是在同一真实性判断框架下对不同介质分别寻找更适合的证据。三、图片鉴伪既要看画面表达也要看像素背后的生成痕迹图片通常是普通用户最先接触到的 AI 鉴伪场景。早期 AI 图片的破绽比较明显例如手指数量错误、文字无法辨认、物体结构违反常识。但随着扩散模型和图像编辑模型持续升级仅依靠语义错误已经不够。现在一张看起来完全合理的图片仍然可能在频域、噪声和局部纹理中留下生成痕迹。合合信息公开材料中提到其图像鉴伪会综合分析图像语义信息、频谱伪影和噪声分布异常用于判断图片是否由 AI 模型生成或经过篡改覆盖的类型不仅包括 AI 生成还包括 AI 编辑和人工伪造。可以把这些检测维度粗略分成两层。1. 高层语义特征高层语义关注的是“画面表达了什么以及这些内容是否合理”。例如人物、物体与背景之间是否符合常识阴影方向和光源位置是否一致镜面、玻璃和水面反射是否符合物理规律局部替换区域与周围内容是否存在语义冲突文字、标识和重复纹理是否出现异常。但高层语义检测也有局限。生成模型正在变得越来越擅长遵循物理和语义约束。仅靠寻找明显的内容错误很容易漏掉高质量生成图片。2. 底层视觉特征底层特征不主要关心图片画了什么而是研究这张图片“如何形成”。真实相机拍摄通常会经历镜头成像、传感器采样、图像信号处理、压缩编码等过程。AI 生成图片则来自神经网络的逐步生成或重建。两种形成机制不同可能造成不同的频率分布、噪声模式和局部统计规律。例如在肉眼看起来十分平滑的区域模型可能检测到异常的高频分量在看似自然的纹理中可能出现与真实传感器噪声不一致的分布局部 AI 编辑也可能破坏原图连续的成像特征。公开研究同样表明面对越来越高保真的 AI 图片仅使用单一线索并不可靠。AIDE相关研究通过结合高层语义特征与低层噪声、频率特征提高对复杂生成图片的识别能力同时也指出AI生成图片检测远未被彻底解决。需要强调的是AIDE只是投放材料提供的学术参考案例并不等同于合合信息的具体模型架构。它能够帮助我们理解一个行业趋势图片鉴伪正在从寻找单一伪影转向对语义、频谱、噪声和局部结构进行综合判断。3. 实测扫描全能王AI鉴伪小程序图片鉴伪能力针对以上的各种技术问题我准备了18组测试图片最终测试结果如下经过18轮实测在不同场景下扫描全能王AI鉴伪小程序都能够精准分辨出我上传的图片的AI占比以及真实程度。四、视频鉴伪单帧看不出的问题可能会在时间轴上暴露如果把视频拆成一张张静态图片很多 AI 视频的单帧质量已经非常高。但视频比图片多了一个关键维度时间。一个物体在连续帧中的运动需要保持位置、速度、形状、光照和遮挡关系的一致性。生成模型即使能够做好单帧也可能在连续生成过程中产生细微的不稳定。根据合合信息的技术介绍其视频鉴伪会结合视频时序、运动规律、时空频域和传感器噪声等检测维度并关注帧间物体抖动、运动轨迹异常以及时空网格伪影等线索。这类异常未必会表现成明显的“画面崩坏”。例如人脸轮廓在连续帧中发生轻微跳动嘴唇动作与面部肌肉变化不同步背景物体在镜头运动过程中产生不自然的形变饰品、头发和衣物纹理在相邻帧间突然改变物体运动轨迹缺少真实世界中的连续性视频经过生成或重建后留下周期性的时空伪影。人眼观看视频时更关注故事内容和人物动作很难逐帧比较这些细节。算法则可以把连续帧转化为时序信号对运动和频率分布进行系统分析。这也是视频鉴伪不能简单等同于“对每一帧执行一次图片鉴伪”的原因。单帧检测只能提供空间证据而视频还需要利用时间轴上的一致性证据。视频场景实测结果如下图所示我这里准备了五组不同场景的视频经过扫描全能王AI鉴伪小程序鉴别之后我们可以看到结果如图所示精准的分辨出了真实视频和AI内容大家如果有好的视频也可以直接前往小程序测试体验另外在“AI较真大赛”中也可以更直观的体验AI视频鉴伪的价值如下图所示为真假视频辨别关卡五、文本鉴伪统计“AI味”已经不够需要进入语义和逻辑层相比图片和视频文本鉴伪更加容易引发争议。这是因为文字本身不存在传感器噪声也没有稳定的像素频谱。人类和 AI 还可以使用相同的词汇、语法和写作模板。一篇由人类撰写的公文可能非常规范一篇经过精心提示和人工改写的 AI 文本则可能十分自然。传统文本检测往往依赖词频、句长、标点使用习惯或者困惑度等统计特征但这些特征容易受到同义词替换、句式重写和提示词设计的影响。合合信息公开介绍称其生成式 AI 文本鉴定会从表层统计进一步进入语义层分析模型生成过程中容易出现的高概率表达形式并关注 AI 文本与人类写作在深层语义连贯性、句法结构微小畸变以及高维逻辑表征上的差异。这里可以用一个简单例子理解。一段文本的每一句话单独看都可能正确但把整段内容放在一起可能出现以下情况不同段落重复表达同一个结论论点之间缺少真实的因果推进内容看似完整却回避具体事实或限定条件句法结构过于稳定缺少自然写作中的变化局部措辞自然但全文逻辑表征呈现异常一致性大量使用高概率、安全但信息密度较低的表达。这些特征不一定能被读者明确指出却可能在模型的高维表示空间中形成可检测的模式。不过文本检测结果尤其需要谨慎使用。检测器不应仅凭某种“写作风格”否定内容更不能把一次模型判断直接作为学术不端、职业处罚或法律责任的依据。更合理的使用方式是将文本鉴伪作为风险筛选工具并结合版本记录、引用来源、写作过程、事实准确性和人工复核作出综合判断。文本部分我也做了一些实测结果如下图所示通过不同纬度的文案测试文本鉴伪部分对AI味道的文案能够有效的区分大家有想测的文案欢迎评论区交流讨论也可以直接前往小程序体验六、线上“AI较真大赛”最有意思的地方它暴露了人类判断的不稳定除了上传素材进行检测合合信息还在线下的WAIC展位设计了“AI较真大赛”互动挑战内容包括转账截图、社交媒体人像照片、萌宠视频和论文文本等。参与者需要先依靠自己的观察作出判断再与 AI 检测结果进行对比。从技术角度看这种形式比直接罗列准确率更容易让普通用户理解鉴伪的必要性。当我们看到一张转账截图时通常会关注姓名、金额和时间是否合理却不一定检查字体边缘、背景纹理和局部压缩特征看到一段人物视频时会被说话内容吸引很少逐帧分析嘴部、眼睛和背景的运动一致性。人类的判断还会受到先入为主的影响。当题目提示“其中可能有一张是真的”用我们可以主动寻找异常但在真实社交平台中人们往往默认收到的内容是真的。相同素材放在不同上下文中判断结果可能完全不同。所以“人眼与 AI 对比”的意义并不是证明机器永远比人更正确而是说明面对规模化、跨介质和高仿真的生成内容真实性判断已经无法只依赖个人经验。七、真正的产品价值不是代替人下结论而是承担规模化初筛对开发者和企业技术决策者来说评估一套鉴伪技术时不应该只问“它能不能判断一张图”。更关键的问题是能否处理不同生成模型和不同伪造方式能否覆盖图片、视频和文本等多种业务输入能否承受截图、压缩和二次编辑带来的分布变化能否提供置信度或其他可供业务系统使用的风险信号能否接入审核、风控和内容治理流程能否在实际业务量下稳定运行。合合信息披露其 AIGC 鉴伪技术已经应用于金融、保险和电商等场景仅图文鉴伪技术即可完成日均数十万条内容的全量核验并逐步替代传统的人工抽样审核方式。这里体现的是自动化鉴伪与人工审核之间的根本差异。人工审核适合处理复杂、模糊和需要上下文判断的案例但很难对海量内容逐条检查。算法系统则适合完成高并发初筛、风险排序和异常发现再把少量高风险内容交给人工复核。这种组合可以应用在很多具体场景中金融与支付检查转账截图、收入证明、电子凭证或业务材料是否存在局部篡改并将高风险材料转入人工审核。保险理赔识别事故图片、票据、视频和说明文本中的生成或编辑痕迹辅助发现重复理赔、伪造材料和内容不一致问题。电商平台检测商品图片、评价截图、聊天记录和售后材料中的异常辅助处理虚假宣传与交易纠纷。内容平台对图文资讯、短视频和用户投稿进行自动化风险筛选减少虚假内容在传播链路中的扩散。学术与教育将 AI 文本检测作为辅助信号同时结合引用、实验数据、写作记录和人工审查判断内容的真实性与原创性。八、也要理性看待鉴伪不是一劳永逸的“终局技术”生成技术和鉴伪技术之间本质上是一场持续演化的攻防。新的生成模型不断减少旧有伪影内容还可能经过压缩、滤镜、截图、转码和人工修改。检测系统如果过度依赖某个模型或某种固定特征面对未见过的生成器时就可能出现性能下降。学术研究已经反复说明真实网络环境中的高质量生成内容往往比标准测试集中的样本更加难以识别。AIDE在研究中评估多个现有检测器时发现它们在更贴近真实环境的高保真 AI 图片上可能出现明显的泛化问题。此外检测结果的可解释性同样重要。如果系统只输出一个概率却无法说明风险来自哪里审核人员就很难继续验证。FakeShield等公开研究已经开始探索同时进行图片真假判断、篡改区域定位和人类可理解解释这也说明鉴伪技术正在从单一分类逐步走向“判断—定位—解释”的完整链路。这类研究同样只是行业技术方向的参考不能直接用于推断合合信息采用了相同的模型结构。对普通用户而言最稳妥的原则仍然是检测结果可以提高警惕但不应脱离来源、上下文和其他证据被直接视为最终裁决。结语从“我觉得是真的”转向可验证的内容可信机制生成式 AI 带来的问题并不是网络上突然多了一批“假图片”。真正的变化在于图片、视频和文本都可以被低成本地生成、修改和批量传播而普通用户很难判断内容经过了什么处理。在这个背景下合合信息将 AI 鉴伪能力从图像和人脸视频进一步扩展到图片、视频、文本等主要信息介质其意义并不只是多支持了几种文件格式而是试图建立一套覆盖不同内容载体的可信鉴别体系。相关技术展示面向开发者及技术决策者重点呈现扫描全能王在 AI 鉴伪方面的能力深度。从线上体验和公开技术信息来看我认为这类工具最现实的定位有两种对普通用户它是一种低门槛的真实性检查入口帮助我们在转发、付款或采信内容之前多做一次验证。对企业和平台它更适合作为自动化风险筛选基础设施对海量图片、视频和文本进行初步核验再与人工审核、来源验证和业务风控机制配合。当生成内容越来越接近真实“看起来没有问题”已经不能等同于“内容可信”。开发者也需要开始考虑未来的 AI 应用不仅要能够生成和理解内容还应当具备判断输入是否真实、来源是否可靠、内容是否经过修改的能力。想测试自己能否分辨 AI 生成和篡改内容可以进入合合信息扫描全能王AI鉴伪小程序分别准备真实素材、AI 生成素材和二次编辑素材进行对照测试。相比只测一张图更建议同时测试图片、视频和文本并重点观察不同处理方式是否会影响检测结论及置信度。