2026 数字人生成评测报告:Heygen、OmniHuman、Kling等大模型同台竞技,谁能率先跨越“恐怖谷”?
从虚拟偶像到AI主播,数字人技术已悄然来到我们身边。
当算法一键生成视频,这些数字人究竟有多逼真?它们是已经与真人无异,还是仍在“恐怖谷”的边缘徘徊?当AI驱动的口型试图模仿人类,我们的眼睛能否分辨真假?
为了探寻答案,AGI-Eval评测社区正式发起「2026数字人生成评测报告」,本次报告基于 770名真人用户的真实反馈,同时覆盖6大场景、3级难度的 508 份评测素材,对市面上9款主流模型进行了全面、深入的端到端效果评估,产出 13,240条评测结果。本文将聚焦其中公开可用的主流模型,旨在揭示当前数字人生成技术的能力边界与核心挑战。

△ 各模型主观拟人度总分及排名
一、评测核心结论
评测结果显示,当前数字人生成技术已取得长足进步,但各模型间的表现分化较为明显。
从各模型得分来看,Heygen(2.923分) 在拟人度指标上获得的评分最高,字节跳动的OmniHuman-1.5(2.813分) 紧随其后,两者得分差距较小,整体表现均处于参评模型的前列。其余参评模型的得分相对接近,其中Hedra(2.741分)、快手Kling Avatar 2.0(2.706分)和夸克OmniAvatar(2.649分) 三者的分数较为集中,彼此间的分差不超过0.1分。总体而言,得分最高的模型与得分居中的模型之间存在一定的分数差距,反映出当前各产品在技术成熟度和表现力上仍有不同的进展阶段。
尽管各模型在特定应用场景下已能实现以假乱真的效果,然而整个行业依然面临共同的技术瓶颈:
- 多人场景是最大难点: 所有模型在处理多人视频时得分均显著下滑,这是拉开模型差距的关键。
- 中文生成更具挑战: 所有模型在英文上的表现均优于中文,高质量的中文口型与表情协同是核心技术壁垒。
- 口型不匹配是普遍痛点: 这是导致AI生成痕迹的最主要原因,也是所有模型都需要攻克的难题。
- 复杂场景与动画风格是共同短板: 面对复杂输入或动画风格时,所有模型表现均大幅下降。
二、评测方案与流程介绍
一套科学、严谨的评测方案是所有结论客观公正的基石。
2.1 参评模型
本文将重点分析其中公开可用或广受关注的模型,如 Heygen、OmniHuman-1.5、Kling Avatar 2.0 等。
2.2 评测方法:主观与客观结合

- 主观拟人度评测: 770名真实用户对508组视频进行1-5分匿名独立打分。
- 客观问题分析: 10名内部专家依据详尽的标注体系,从合理性、协调性、稳定性、一致性四大维度进行逐帧标注。

△ 评测方案流程图
2.3 数据集构建
多维度、多场景、多难度评测数据集围绕真实世界应用构建,覆盖六大真实场景和中、英两种主流语种。输入素材从“图片”和“语音”两个维度进行难度拆分,每个维度下设简单、中等、复杂三级。
三、场景化深度剖析
我们将按照场景复杂度递增的顺序,对各模型进行横向剖析,并基于真实评测数据进行解读。
场景一:新闻时事 (技术舒适区)
分析: 此类场景通常为单人正面、语音平稳,是数字人生成最基础的工况。我们预期所有模型在此都应有良好表现,但评测结果却出乎意料,揭示了即便是基础场景,各模型的能力也存在显著差异。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 1.67)
表现分析: 在这一基础场景下,Heygen的表现未达到预期,用户评分很低。尽管视频主体动作流畅,但专家在检查中发现,其生成的人物面部细节出现了不合理的形态问题,特别是牙齿部分的渲染存在明显瑕疵,这严重影响了用户对其真实性的感知。
- Kling Avatar 2.0 (得分: 2.0)
表现分析: Kling的表现同样不佳。在合理性层面,专家标注出关键问题:人物手部出现了不合理的形变,影响了画面的真实感,导致其用户评分处于较低水平。
- OmniHuman-1.5 (得分: 3.67)
表现分析: 在此案例的横向对比中,OmniHuman表现最佳,获得了远高于另外两款模型的用户评分。然而,它并非完美无缺。专家同样指出了其在细节合理性上的不足,具体表现为人物牙齿形态的轻微畸变,以及背景中出现了无法辨认的乱码文字。这说明即使用户接受度更高,底层的技术挑战依然存在。
场景小结: 即便是最基础的生成任务,当前主流模型也远未达到稳定可靠的水平。OmniHuman在此案例中表现相对最好,但所有参评模型都在合理性层面暴露了问题,特别是在处理画面中的次要细节(如牙齿、背景文字)时,普遍存在生成缺陷。
场景二:知识教育 (单一维度压力测试)
分析: 此场景同样为单人,但语音包含更多停顿和细节变化,对模型的精细同步能力提出了初步挑战。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 2.0)
表现分析: Heygen在此案例中得分偏低。专家指出,虽然口型同步存在严重问题,人物的表情显得较为单一和不协调,未能很好地配合语音进行变化,影响了整体的拟人度。
- Kling Avatar 2.0 (得分: 3.0)
表现分析: Kling的整体表现良好,在此案例中没有发现明显的技术问题,视频流畅自然,获得了不错的用户评价。
- OmniHuman-1.5 (得分: 2.33)
表现分析: OmniHuman在此场景下表现还可以。在合理性层面,遵循物理世界的光学定律,人物的身体部分自然移动;但在稳定性层面,更明显的问题是13-14秒出现跳帧情况。这些问题的叠加,严重降低了视频的真实感。
场景小结: 即使只是增加了语音的少许变化,模型间的性能差异也开始显现。Heygen暴露了表情协调性的问题,而OmniHuman则在稳定性和合理性上出现短板。
场景三:商业推广 (画面元素合理性测试)
分析: 商业推广场景引入了产品、logo等额外元素,考验模型在处理主体人物之外,对整个画面环境的理解和生成合理性。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 2.0)
表现分析: Heygen的口型同步、主题人物动作在此案例中出现了轻度不匹配。专家发现,视频背景中的文字出现了无法辨认的乱码。这意味着模型未能准确地重构环境中的文本信息,这一点在需要展示品牌信息的商业场景中可能是致命伤。
- Kling Avatar 2.0 (得分: 2.0)
表现分析: Kling同样存在轻度的口型不匹配问题。此外,在合理性层面,专家发现人物的牙齿部分出现了轻微的畸变。
- OmniHuman-1.5 (得分: 3.0)
表现分析: OmniHuman在此案例中虽然用户评分相对较高,但暴露出的问题最为严重。在协调性层面,不仅口型被专家标记为重度不匹配,人物的表情和动作也与语音内容显得格格不入。
场景小结: 商业场景对画面的整体质量要求更高。评测显示,在中文语境下,所有参评模型的口型协调性都面临挑战。OmniHuman虽然在某些简单场景表现不错,但在此处的多维度问题暴露了其不稳定性。
场景四:影视娱乐 (复杂情感与语速压力测试)
分析: 影视片段通常包含演员丰富的情感表达和快速变化的语速,这对模型的协调性,即口型与情感的同步表达能力,构成了极大的挑战。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 2.33)
表现分析: Heygen的表现尚可。专家指出,虽然其口型出现了轻度不匹配,但更主要的问题在于人物表情未能跟上语音中蕴含的丰富情感,显得较为平淡。这表明,当语音信息变得密集和复杂时,其音画同步的准确率有所下降。
- Kling Avatar 2.0 (得分: 1.33)
表现分析: Kling的表现在此场景下急转直下。协调性问题全面暴露,不仅口型被专家标记为重度不匹配,面部表情也与声音中的情绪完全脱节,音色也发生变化。此外,还出现了将背景音错误识别为说话声而导致的多余口型动作,存在一致性上说话人数不匹配问题。这说明该模型在当前版本下,难以处理包含丰富情感和非语言信息的复杂语音输入。
- OmniHuman-1.5 (得分: 4.33)
表现分析: 在此轮压力测试中,OmniHuman表现最为出色。虽然也存在轻微的口型不匹配和人物相貌的小幅变化,但它较好地捕捉了语音中的情感起伏,并转化为相对自然的表情变化,展现了其在理解复杂音频上的鲁棒性
场景小结: 复杂语音是拉开模型差距的关键因素。能否准确捕捉并表达语音中的情感、节奏和非语言信息,是模型协调能力高低的体现。在这一维度,OmniHuman表现出了相对的优势。
场景五:日常生活 (多人交互与中文语境压力测试)
分析: 此场景将难度再次升级,引入了“多人交互”和“中文语境”两大挑战。这不仅考验模型的“一致性”,即能否正确分配说话者,也考验其对更复杂口型的中文的适配能力。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 3.0)
表现分析: Heygen在多人交互中同样出现了一致性问题,嘴型同时动,未能正确处理轮流对话。此外,其口型在处理中文发音时也出现了明显的不协调。
- Kling Avatar 2.0 (得分: 1.0)
表现分析: Kling同样在此场景惨败。在一致性层面,模型完全无法将声音与正确的说话人对应,导致对话逻辑混乱。在合理性层面,主体人物不合理,人物的身体甚至出现了不自然的畸变。
- OmniHuman-1.5 (得分: 1.0)
表现分析: OmniHuman的表现同样不尽人意。在稳定性上出现了声音变声的问题,协调性也不足,出现了音画不匹配和口型不匹配的问题
场景小结: 多人、中文、复杂交互是当前所有主流模型的“阿喀琉斯之踵”。在这一极限压力下,模型普遍出现一致性、协调性和稳定性等多维度、系统性的崩溃。这明确指出了行业未来最需要攻坚的技术方向。
场景六:唱歌 (跨域与极限同步挑战)
分析: 我们将唱歌和动画两个极具挑战性的场景合并分析,前者考验音画同步的极限,后者考验模型的风格泛化能力。

☞【AGI-Eval大模型评测】看原版实测视频
- Heygen (得分: 1.0):
表现分析: 在唱歌场景,Heygen在合理性上出现了问题,生成的人物身体部分发生了不符合物理规律的运动和畸变,专家标注其口型为重度不匹配,完全跟不上歌曲的节奏和发音,导致观感不佳。
- Kling Avatar 2.0 (得分: 1.33):
表现分析: Kling的表现同样不理想,口型问题被标记为重度。除此之外,在合理性层面,还出现了人物身体和背景光影的不合理形变,协调性、音画不匹配和口型不匹配等问题更为复杂。
- OmniHuman-1.5 (得分: 3.0):
表现分析: OmniHuman虽然用户评分相对较高,但也未能真正应对唱歌的挑战。专家标注其存在人物相貌变化、背景文字乱码、身体畸变以及光影不合理等多个维度的问题。
场景小结: 唱歌是对音画同步和生成稳定性的极限压力测试,目前所有参评模型在这一场景下均表现不佳,普遍出现口型、合理性等多维度问题,难以达到可用水平。
四、总结与展望
本次AGI-Eval的评测清晰呈现了数字人生成技术的当前格局。以Heygen、OmniHuman为代表的模型在多数场景下表现稳健,但尚未能全面应对所有挑战;Kling、Hedra等模型则各有潜力与不足。模型在多人场景和音画一致性上表现分化,口型协调的精细度和复杂场景的泛化能力仍是全行业共同难题,其中“多人、复杂、中文”构成当前亟待突破的瓶颈。
未来数字人生成技术的发展,不仅需要在简单环境下做到基础的口型同步,更关键的挑战是在复杂动态环境下保持稳定的高质量生成。 这并非单一技术的突破,而是需要多人对话的智能编排、微表情的真实还原、以及情感的精准传递等多种能力的共同作用。当模型能够系统性地解决这些问题,数字人才会真正消除不自然感,无缝地融入我们的数字生活。
更多推荐


所有评论(0)