首页 - 财经 - 滚动新闻 - 正文

从“生成世界”到“理解世界”:昆仑万维升级背后的AGI路线图

(原标题:从“生成世界”到“理解世界”:昆仑万维升级背后的AGI路线图)

出品 | 子弹财经

作者 | 白华

编辑 | 闪电

美编 | 倩倩

审核 | 颂文

7月19日WAIC期间,昆仑万维以一场“世界模型与多模态范式跃迁”专场论坛,宣告了一个信号:2026年,被定义为“世界模型元年”。

这不是一家之言。2024年,李飞飞创办World Labs,不到三个月即以10亿美元估值将“空间智能”送入公众视野;2025年,World Labs推出首款商用世界模型Marble与实时模型RTFM;2026年3月,OpenAI关停Sora消费级产品,将团队全面转向面向机器人技术的世界模拟研究。

从谷歌DeepMind的Genie到Meta的JEPA架构,从英伟达Cosmos到国内一批创业公司的跟进,“世界模型”正在取代“大语言模型”,成为AI产业新的叙事主线。

如果说过去三年,行业的核心命题是“让AI能说会画”;那么从此刻起,命题升级为让AI理解重力为什么向下,理解一首歌里没说出口的情绪,理解一个杯子坠落时会发生什么。

伴随这一判断,昆仑万维集中发布了Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型、黎曼动力Riemann-1.0具身模型。三大产品从虚拟世界生成到物理世界交互,指向同一个底层逻辑:AI的竞争不再是“谁能生成得更多”,而是“谁能理解得更深”。

1、AI核心命题的范式转换

过去两年AI行业的核心命题是“生成”,生成文字、图像、视频、音乐。但这些生成的内容,模型自己真的“懂”吗?

答案是否定的。

大语言模型可以写出“苹果从树上掉下来”的句子,但它从未“理解”过重力,因为它从未生活在有重力的世界里。

这正是世界模型要填补的鸿沟。从2026年起,AI的核心命题将从“生成”转向“理解”与“交互”:让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。而世界模型,正是实现这一跨越的关键技术底座。

(图 / 昆仑万维董事长兼CEO方汉)

昆仑万维董事长兼CEO方汉在论坛上系统阐述了他的三大产业预判,每一个都在重新定义AI能力的边界:

第一,世界模型将走出屏幕,进入物理世界。具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演,预判动作后果、评估环境变化、及时调整应对策略。

这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力;谁能训练出在复杂场景中依然“看得懂、做得对”的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟须的底层能力。

第二,游戏行业将率先被世界模型改变。开放世界游戏不再依赖数百人团队数年的手工搭建,Matrix-Game 3.5让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进AIGC的深层发展。Mureka作为中国最强、全球前两名的音乐生成模型,率先去除“AI味”,让普通人也能把模糊灵感转化为有情绪、有温度的作品。

三个预判指向同一个方向,让AI从“会生成”走向“懂世界、能行动”。这也恰好定义了昆仑万维三款新产品各自的使命。

作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5带来了革命性的技术升级。Matrix-Game 3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。

(图 / Skywork首席科学家成宇)

Skywork首席科学家成宇指出,世界模型是具身智能的“无限数据引擎”。传统数据采集面临人工成本高昂、实机采集耗时耗力、效率极低的痛点,无法满足大模型规模化需求。

Matrix-Game 3.5构建了支撑下一代世界模型的无限数据生产体系,突破传统瓶颈,打造三条自动化数据生产管线,输出Video+Pose+Action+Language的高质量训练数据,目前已积累超500万高质量视频切片、超1万有效训练小时数、覆盖1200余个游戏场景。

在技术架构上,Matrix-Game 3.5创新性地将历史帧切分为带有3D坐标的Patch Memory(通过Depth+Pose Lift到世界坐标系),推理时根据当前相机视锥检索可见Patch并重新投影到当前视角形成Mosaic,再作为Memory Token注入DiT,实现长期一致性的Patch级空间记忆。

这一设计将Frame-level FOV Memory升级为Patch-level FOV Memory,带来四大核心优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最大程度保留基座模型动态生成能力的In-context Learning,以及用户可自由编辑记忆块的可控记忆能力。

其次,Mureka v9.5&O3音乐大模型的发布,成为本次论坛最具情感冲击力的时刻之一。

从SkyMusic 1.0内测到Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从“作品成立”到“创作可控”再到“多模态创作”的演进路径。

而v9.5版本首次喊出“最没有AI味的AI音乐模型”这一口号,它不再依赖声部堆砌和复杂编配制造“厉害”的第一印象,而是在真实的音乐框架中,以更为克制的方式处理编配、人声、情绪与Prompt意图,让音乐表达更自然、更真诚。

O3建立在新版V9.5之上,并通过test-time scaling扩展MusiCoT的推理过程。它不是简单地“生成得更多”或“想得更久”,而是让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。额外推理空间被用于回看偏差与自我修正,使音乐CoT能够逐步收敛,而不是一次决定后一路向前。

(图 / 歌曲的主观评分)

从评测结果看,V9.5沿着MusiCoT路线完成了更扎实的底座升级:旋律、人声、音质和编曲全面提升,指令精准度从6.92提升至7.62。它不再把“更满、更复杂”当作唯一标准,而是在真实音乐框架中更克制地处理编配、人声、情绪和Prompt意图,让歌曲更自然、更真诚。

O3则建立在V9.5之上,通过持续推演、回看偏差和修正后续决策,进一步强化旋律发展、编曲结构与指令理解,使歌曲结构更完整、情绪更连贯、段落关系更合理。简单来说,V9.5负责把歌做得更自然,O3负责让模型在交付前多看、多想、多修一遍。

更为重要的是,Mureka已从单一的音乐生成工具演进为完整的“版本化制作”平台。同一创意可快速生成多版本,支持在旋律、人声、结构等维度进行局部保留与替换;Studio将“操作DAW”转化为“指挥创作”,降低门槛、抬高上限。

正如昆仑万维所提出的愿景:AI音乐不再是简单的消费内容,而是升级为一种自我表达的语言。用户不仅是被动聆听者,更是主动表达者与参与者。

最后,黎曼动力机器人近期推出的Riemann-1.0,是其成立以来首个公开发布的成果,面向Physical AI的新一代Embodied World Action Model。

该模型基于超过23.2万小时多源具身交互数据训练,统一融合第一视角人类视频、UMI示教与异构机器人轨迹,并提出全因果世界动作建模架构与三阶段渐进式具身预训练框架。

Riemann-1.0不再停留于仿真环境中的离线评估,而是在多个国际主流机器人Benchmark与真实机器人任务上同步实现仿真与真机双SOTA,为机器人操作、实时自适应控制及高频人机协作等Physical AI场景提供了从“理解世界”到“干预世界”的生成式行动基础设施。

2、产业落地,直击游戏、影视痛点

技术突破不是终点,产业验证才是。昆仑万维的产品正逐步走向生产线,在影视、游戏、音乐等场景中接受市场的真实检验。

先看影视行业的短剧、AI漫剧,中国网络视听协会发布的2026年第一季度《微短剧创作指引》显示,2026年一季度全行业上线微短剧约12.8万部,其中AI生成内容占比超过95%。DataEye数据显示,2026年以来,每月都有超1万部AI漫剧上线。

爱奇艺高级副总裁杨海涛从平台数据出发,透露爱奇艺后台每日收到超3000部AI短剧与上千部AI漫画,AI内容观看数据持续提升。他以爱奇艺“燎原计划”扶持的网络电影《勿念》为例,AI在电影镜头特效制作方面实现超50%的提效,从导演构思到成片可节约三周以上的时间,他预计暑期将上线更多AI参与的网络故事片。

但繁荣之下,痛点也随之浮出水面。最突出的两个问题是:画面一致性的缺失与“活人感”的不足。

大量AI生成的短剧作品质量参差不齐、同质化严重。全国范围内能有优质、原创且稳定产出的AI影视团队不足百家。有调研数据显示,超过四成用户对AI生成配音情感不足感到不满,认为AI生成的角色过于扁平。

演员王珞丹分享了自己的AI创作体验,为求一个理想镜头,熬夜“抽卡”到凌晨4点,反复调整提示词,直到清晨才终于抽到满意的镜头。

面对影视行业的“抽卡”等困境,昆仑万维以SkyReels系列和全栈AI能力给出了系统性解法。

在画面一致性上,SkyReels已成为行业标杆。2026年2月推出的SkyReels-V4,在Artificial Analysis Text-to-Video(With Audio)与Image to Video(With Audio)两大榜单登顶全球首位,超越Kling 3.0、Google Veo 3.1、Sora 2等全球主流模型,支持音画同出、逻辑推理及多帧参考等高阶能力。

青年导演崔睿表示,昆仑万维的AI视频模型SkyReels在一致性方面非常突出,能有效解决创作者最头疼的“抽卡”效率问题,在系列化制作中保持人物、物体的稳定统一,避免反复尝试的无效劳动;同时音画同步能力也值得肯定。整体来看,他认为AI视频工具值得创作者去尝试和使用。

中国电影家协会副主席黄晓明的体验则展示了技术的快速进化:三个月前看一部AI生成的电影,还能明显看出AI的表演痕迹;“但最近再看,细节到脸上的斑点毛孔,甚至微表情、毛孔都在演戏”,他已经完全分辨不出来了。

此外,全球游戏产业正经历一场结构性阵痛。据Newzoo数据,传统3A大作的平均开发周期5年,成本已飙升至数十亿美元级别:米哈游为打造《原神》投入了4年研发周期与每年超2亿美元的运营成本,Rockstar的《GTA6》更是让玩家等待了十二年。

摩根士丹利2026年报告测算,生成式AI可将3A游戏开发成本削减44%,释放约220亿美元增量利润。但现实中,AI在游戏研发中的落地仍面临核心矛盾:成本、效率与品质的“不可能三角”。

方汉的判断是,开放世界游戏不再需要数百人团队数年手工搭建,Matrix-Game 3.5让虚拟世界随玩家行动实时演化。Matrix-Game系列已成为英伟达SANA-WM、Adobe RELIC等国际头部大厂世界模型的对比基准,DiT作者谢赛宁团队基于其2.0版本发布了全球首个多人视频世界模型Solaris。这意味着,在下一代AI基础设施的起点上,中国公司与全球巨头站在同一刻度线。

但方汉也坦承推理成本是瓶颈,“不能买一张百万级H200只为玩3D游戏”,预计3—5年内解决。

这一判断与行业趋势高度吻合,根据ResearchIntelo预测,随着推理效率提升和硬件成本下降,世界模型在游戏领域的渗透率将在2028—2030年间进入爆发期。

在WAIC论坛上,方汉说了一句话让现场很多人印象深刻:“我们反对拿着锤子找钉子,主张拿着钉子找锤子。”这句话概括了昆仑万维的AGI路线,即从行业需求倒推技术方案,而不是先造一个模型再找出路。

3、结束语

当前AI行业的主流策略是“单点极致”,在文本、图像、视频或音乐的某一垂直方向上做到极致,以技术壁垒构建护城河。而昆仑万维选择了一条不同的路:大模型覆盖语言、图像、音乐、具身等,形成从“内容生成”到“世界理解”的全栈能力。

昆仑万维的逻辑是:世界模型天然需要多模态协同。因此,从2022年“All in AGI与AIGC”到2026年宣告“世界模型元年”,昆仑万维完成了从全模态内容生成到可交互世界理解的关键跃迁。

当生成能力已不再是稀缺品,理解力的深度,例如对空间、音乐、物理规律的因果建模,将成为AI下半场真正的护城河。世界模型元年,只是一个开始。正如方汉所言:“这不只是一家公司的回答,更是中国AI从研发走向产业应用的一个缩影。”

游戏、影视、音乐、机器人的生产方式正在被重新书写,而2026年的这一声发令枪,才刚刚响过。

fund

APP下载
广告
好投资评级:
好价格评级:
证券之星估值分析提示机器人行业内竞争力的护城河良好,盈利能力较差,营收成长性较差,综合基本面各维度看,估值偏高。 更多>>
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-