Scaling Law 失灵,世界模型成 AI 进入物理世界的关键中间层

AI 挺进真实物理世界,世界模型成焦点

下一代 AI 公司未必诞生在参数、论文和算力最强处,也可能在真实场景密集、产业反馈频繁、工程迭代快的地方。因为 AI 改变世界需进入产业现场,提升世界运行效率。如今,AI 正“逃离”纯文本,挺进真实物理世界。

1 月 8 日,北京智源研究院发布《2026 十大 AI 技术趋势》,将世界模型列为通向 AGI 的重要共识方向,提出从预测下一个词向预测世界下一个状态的范式迁移。随后,产业界动作不断。大额资金涌向有“世界模型”标签的企业,如 3 月份极佳视界完成约 15 亿元融资,其 GigaWorld - 1 在 WorldArena 评测中登顶;从 3 月至今,吸金 35 亿,被称为“国内首个世界模型独角兽”。此外,智平方 B 轮系列融资超 10 亿元,估值过百亿;千寻智能 2026 年开年三个月内完成四轮融资、吸金 45 亿元;星海图继 2 月近 10 亿元 B 轮后,4 月再拿近 20 亿元 B + 轮。二级市场也表现出“偏爱”,4 月 17 日,“物理 AI”新股群核科技上市首日大涨 144%;生数科技两个月累计融资 26 亿元,投后估值超 120 亿元,传出最快 2026 年启动港股 IPO 的消息。

各个领域玩家也纷纷行动。4 月 16 日,腾讯和阿里同日发布世界模型产品,腾讯推出开源的混元 3D 世界模型 2.0(HY - World 2.0),阿里端出主打实时交互的 HappyOyster。车企动作更激进,吉利发布 WAM 世界行为模型,华为乾崑坚持 WA 路线,Momenta 押宝世界模型。机器人领域,英伟达、智元、星海图等也有相关布局。海外同样火热,图灵奖得主 Yann LeCun 创立专注世界模型的 AMI Labs,获 10.3 亿美元巨额种子轮融资;李飞飞创立的 World Labs 完成 10 亿美元融资,首款商业产品 Marble 上线;OpenAI 宣布进入机器人赛道。那么,世界模型为何突然成为必争之地?

Scaling Law 放慢,行业寻找语言之外的答案

AI 巨头达成新共识:只靠文本似乎到不了 AGI。过去,大语言模型靠预测下一个词实现能力跃迁,行业认为扩大参数、增加数据、堆积算力就能迎来 AGI。然而 2026 年,Scaling Law 开始失灵。以 OpenAI 为例,GPT - 4.5 在模型迭代中“更大预训练”有提升,但不是最有效能力来源。同时,数据墙出现,互联网高质量文本数据几乎被采集殆尽,Epoch AI 估计,语言模型将在 2026 - 2032 年用尽可用于训练的高质量人类公共文本。而且,即便有最大语料库,AI 也无法真正理解物理常识,因为语料库记录的是人类描述世界,而非物体运动,物理常识在文本中稀缺,导致大型预训练模型在物理常识题上能力较低。

多模态模型也未解决问题。BLINK 基准显示,GPT - 4V 和 Gemini 在深度、空间对应、多视角推理任务上表现不佳;PhysBench 测试表明,AI 对物理的理解不会随模型大小、训练数据量或视频帧数稳定提升。这种局限性体现为企业落地 AI 时的幻觉问题,在高容错成本场景中,LLM 无法建立稳定可靠的物理因果推理能力,这也是许多企业级应用停留在辅助层的原因。从“语义理解”到“物理推理”存在鸿沟,这是世界模型被关注的底层原因,而具身智能发展到瓶颈期则是更直接原因。世界模型为具身智能提供了新解法,它本质是“可学习的物理模拟器和渲染引擎”,让 AI 通过“视觉思维链”预测物理环境变化,赋予 AI 看懂时空、感受重力、理解现实的能力,是 AI 转化为生产力的必经之路。

不同阵营的物理 AI 卡位战,抢占下一份生产力入口

如果上一阶段大模型竞争比的是文本理解与生成,那么世界模型竞争核心变为将 AI 带进可计算、可交互、可训练的物理世界。当前产业界对世界模型的集体押注,是各行各业寻找 AI 下一份生产力入口。然而,世界模型远未成熟,既无统一技术路线,也非短期内能替代大语言模型的万灵药,甚至定义都未统一。如智源研究院院长王仲远提出四大分类,李飞飞团队给出三类功能框架。

业内处于不同行业向“理解物理世界”靠拢的产业初试阶段。视频生成派凭借强大视频生成引擎行动起来,生数科技、阿里、快手、字节及海外的 Sora、Runway 构成这股力量,这得益于 AR - DiT 等实时交互技术突破,但该路线隐患是学到的画面连贯而非物理为真,缺乏真实三维结构。空间智能玩家主张“先重建,再理解”,代表有李飞飞的 World Labs 和国内的群核科技,腾讯混元也切入此路。具身智能领域对世界模型需求极度迫切,因为世界模型能让机器人在“想象”中演练技能,这解释了资金为何涌向有“世界模型”标签的企业,但该领域路线分歧深,各条路线正走向技术融合。车企与智驾厂商把世界模型开上了路,智驾有海量真实路测数据和明确付费场景,自动驾驶仿真已落地应用,用其合成危险场景测试效率更高。从不同角度看,各行业向物理 AI 收敛,短期创意设计最快变现,中期智能驾驶拉开差距,长期世界模型将成为连接数据、仿真与行动的物理 AI 基础设施,是 AI 从数字世界走向物理世界的关键中间层。当产业入口跑通,市场竞争将向产业链深处沉降。

下一代 AI 公司,理解世界、模拟世界、行动于世界

世界模型重要,不仅因为它代表新模型路线,更因为它将 AI 战场推向物理世界。大语言模型主要战场是数字世界,而世界模型目标是预测、生成、干预和改造物理世界,其竞争发生在产业链深处,如谁拥有高质量物理数据、掌握仿真和评测平台、能连接真实设备、形成反馈闭环。世界模型是 AI 进入物理世界需重建的基础设施,未来物理 AI 技术栈可能包括物理数据采集、数据清洗与合成等多个层面。它将成为物理 AI 时代的操作系统,连接芯片、传感器、机器人本体和 Agent、行业软件、企业业务系统,接收真实世界数据,生成虚拟世界。

世界模型让 AI 具备进入物理产业的可能,这使中国公司在竞争中更值得关注。在物理 AI 时代,场景密度、工程能力等同样重要,而这是中国公司的优势。中国有完整制造业体系、复杂交通场景、快速增长的机器人产业链等,是世界模型所需物理数据来源和落地土壤。世界模型竞争不仅在实验室和云端,也在车间、道路等真实场景中,谁能更快接入场景、获得反馈,谁就可能建立工程闭环和数据飞轮。这意味着,下一代 AI 公司可能诞生在真实场景密集、产业反馈频繁、工程迭代快的地方,因为 AI 改变世界需进入产业现场,提升运行效率。那么,哪些中国公司能在这场竞争中脱颖而出呢?

大气污染是影响公众健康与生态环境的重要问题,精准的空气质量时空预测与污染源贡献度量化是精准治污的关键支撑。针对现有研究多源融合不充分、时空关联刻画不足、预测与源解析割裂三方面缺陷,本文设计实现了城市空气质量时空预测与污染源贡献度分析系统,融合监测、气象、工业排放与交通四类数据,构建基于时空注意力的LSTM(STAM-LSTM)预测模型与基于正定矩阵因子分解(PMF)的源解析模型,形数据融合-特征工程-预测-源解析-可视化闭环。 系统实现四类数据时空对齐与融合,构建时序与空间邻域特征,以普通克里金插值生1km网格浓度场;STAM-LSTM引入时空注意力自适应学习站点间污染传输时变权重,以72小时输入预测未来24小时逐小时PM2.5浓度;PMF识别交通、工业、燃煤、扬尘与二次生五个源因子,量化各源全年贡献度并分析时空演变。 实验表明:STAM-LSTM预测RMSE 24.6、MAE 17.8、R² 0.88,相对LSTM基线(30.2)提升18.5%;普通克里金插值误差8.9,优于反距离加权(11.4);源解析显示交通源28.4%、工业源23.1%、燃煤源19.6%为主要贡献源,冬季燃煤源升至27.3%、早高峰交通源达34.8%,下风向工业源贡献高出上风向8~12个百分点;减排情景显示交通源减排20%可使年均PM2.5下降5.7%,与源贡献度排序一致。 系统按五模块14组件实现,功能测试16项用例全部通过,为大气污染预警、源管控与减排政策制定提供了决策依据。 【课程报告内容】 摘要 第1章 绪论 第2章 相关技术与理论 第3章 系统需求分析 第4章 系统总体设计 第5章 系统详细设计与实现 第6章 系统测试与分析 第7章 总结与展望 参考文献 附件-实现指南
基于iTransformer-BiGRU-KAN多模型融合的滚动轴承剩余寿命预测研究(Python代码实现)内容概要:本文提出了一种基于iTransformer-BiGRU-KAN多模型融合的滚动轴承剩余寿命预测方法,旨在通过结合多种先进深度学习模型的优势,提升在复杂工况下的预测精度与鲁棒性。该方法利用iTransformer捕捉长期时间序列中的全局依赖关系,通过BiGRU模型提取双向时序特征,最后引入KAN(Kernel Attention Network)增强非线性映射与关键特征的自适应加权能力,实现对轴承退化过程的精准建模。文中详细介绍了模型架构设计、训练流程及在公开数据集上的实验验证,结果表明该融合模型相比单一模型在预测精度和稳定性方面均有显著提升。; 适合人群:具备一定机器学习与深度学习基础,从事设备故障诊断、工业大数据分析或智能运维相关领域的研究人员及工程技术人员,尤其适合研究生及以上学历或有相关项目经验的专业人员。; 使用场景及目标:①应用于工业设备状态监测与预测性维护系统中,实现对滚动轴承等关键部件剩余寿命的精准预测;②为复杂时间序列回归任务提供多模型融合的设计思路与技术参考;③推动深度学习在智能制造与工业物联网领域的落地应用。; 阅读建议:建议读者结合Python代码实现部分,深入理解各子模型的接口设计与融合逻辑,重点关注特征融合机制与注意力权重的可视化分析,以便在实际项目中灵活调整与优化模型结构。
代码下载地址: https://pan.quark.cn/s/f675b88243cd 《华大HC32L110库函数与例程详解》 华大HC32L110属于低功耗且高性能的微控制器,在众多嵌入式系统设计中具有广泛的应用,特别是在需要电池供电的物联网设备和便携式装置中表现出色。该微控制器的库函数与例程为程序设计者提供了重要的参考资料,包含了丰富的功能接口和示范性代码,从而辅助开发者迅速掌握并运用该芯片。库函数是事先编写完且可反复使用的代码单元,针对HC32L110的特定硬件特性进行了优化,使得开发者无需深入探究底层机制,仅需调用相应的库函数即可达预期功能。这些库函数一般涵盖了时钟管理、GPIO操控、ADC转换、串行通信(包含UART、SPI、I2C等形式)以及中断管理等多个方面。比如,若需将一个GPIO端口设置为输出模式并设定其电平状态,开发者可通过调用`HAL_GPIO_Init()`与`HAL_GPIO_WritePin()`函数来实现。 例程则是展示如何运用库函数的应用范例代码,它们具体说明了在实际操作中如何适当地调用库函数及设定相关参数。以HC32L110的串行通信例程为例,它可能涉及初始化UART接口、传输数据、接收数据等环节,借助这些例程,开发者能够清晰地洞察每个功能的具体实现途径。对于新手而言,例程是理解芯片特性及库函数使用的理想途径。 在华大HC32L110的库函数与例程中,通常包含以下核心组部分: 1. **初始化函数**:诸如`SystemInit()`,其作用是配置系统时钟,作为其他功能的基础。 2. **外设驱动函数**:例如GPIO的`HAL_GPIO_xxx()`系列函数,ADC的`HAL_ADC_xxx()`函数等,用于管理和设定...
【多变量输入超前多步预测】基于CNN-BiGRU的光伏功率预测研究(Matlab代码实现)内容概要:本文研究基于CNN-BiGRU混合神经网络模型的多变量输入超前多步光伏功率预测方法,并提供了完整的Matlab代码实现。该模型结合卷积神经网络(CNN)强大的局部特征提取能力和双向门控循环单元(BiGRU)对时间序列前后向依赖关系的建模能力,能够有效处理光伏发电受光照强度、温度、湿度等多因素影响的非线性、非平稳特性,实现对未来多个时间步长的功率输出进行精准预测。研究涵盖了数据预处理、模型构建、训练优化及结果分析全过程,并通过实验验证了模型在不同天气条件下的预测性能,展示了其在提升预测精度方面的有效性。; 适合人群:具备一定机器学习和时间序列预测基础知识,从事新能源发电预测、电力系统调度或相关领域研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①应用于光伏发电站的功率预测系统,为电网调度、能量管理和电力交易提供数据支持;②作为深度学习在可再生能源预测领域应用的教学案例,帮助理解CNN与RNN类模型的融合机制;③为进一步研究更复杂的预测模型(如加入注意力机制)提供基础框架和技术参考。; 阅读建议:建议读者结合Matlab代码逐步复现文中实验,重点关注数据预处理流程、模型结构设计细节以及超参数调优策略,同时可尝试在不同数据集上验证模型泛化能力,以深入掌握多变量时间序列预测的关键技术要点。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值