三代智能范式的分野,不在模型有多大,而在两件事:学的是什么,以及怎么学。
符号世界
像素世界
物理世界 · 在线演化
不做又一个视频生成工具,也不做机器人本体 —— 我们做的是让视频模型自己变强的方法。越往底层,越是原始创新。
影视剪辑工具 · 安防与合规分析 · 机器人本体与系统集成
参与者众多 · 同质化竞争大语言模型 · 视频生成模型 · VLA 模型 —— 沿用「一次训练、长期不变」的离线范式
巨头与独角兽的主战场让模型在真实场景的反馈中自动评测、自我迭代 —— 改动的是学习范式本身
目前空白 · 我们在这一层做视频生成的只追求画质与时长;做具身的聚焦本体与控制,模型靠外购;做语言的隔着符号,看不见物理世界。自进化视频模型落在所有人的边界之外。
VideoMAE / InternVideo 开创了视频自监督预训练流派,后被图灵奖得主杨立昆团队的 V-JEPA 系列跟随验证;VideoChat-R1 已把强化学习引入视频理解,「自评测—自迭代」链路在我们手里跑通。
四层能力的技术积累均已就位,接入自进化范式即可完成收敛。模型能力正处在临界点上 —— 突破随时可能发生,窗口就在当下。
自下而上构成能力栈:从看懂世界,到理解与预测,再到决策执行,最终由真实反馈驱动自我进化。
表征 → 建模 → 重建
把原始视频转为可计算的时空表征,进而建模并重建三维场景。
VideoMAE · InternVideo
对标图灵奖得主的 V-JEPA 路线
记忆 · 推理 · 预测
跨长视频保持上下文一致,推理事件因果并预测下一步状态。
VideoChat3
StreamForest 记忆 + Video-o3 推理
决策 · 规划 · 执行
把理解转化为可执行的动作序列,驱动物理世界中的设备完成任务。
P-WAM 世界-动作模型
多项指标领先主流 VLA 与 WAM
自评估 · 自迭代 · 自进化
用应用侧回流的真实反馈自动评测与迭代,模型能力随业务持续增长。
VideoChat-R1 · VideoCap-R1
通用奖励模型驱动的自主进化
同一套自进化视频模型底座,按三类空间封装成三个产品 —— 研发投入一次,三个行业同时受益。
纯数字空间 · 媒体与内容
交付形态
云端 API · 私有化部署 · 联合研发
数字物理融合 · 智能制造
交付形态
私有化部署为主(数据不出厂)
纯物理空间 · 机器人
交付形态
模型授权 · 私有化部署 · 联合研发
从动作识别的奠基之作,到被国际大厂采用的通用视频大模型 —— 每一层能力都有公开可查的成果支撑。
TSN · 2016
6,954 次引用
谷歌学术;ECCV 过去 5 年引用 Top10 论文,至今仍是动作识别的标准基线
VideoMAE · 2022
800 万次下载
首个被 Hugging Face 收录的视频 Transformer 模型;NeurIPS 2022 最具影响力论文
InternVideo · 2022–25
60 项任务领先
首个通用视频理解大模型,被 NVIDIA Cosmos 世界模型平台采用
从 2014 年至今,在视频理解这条赛道上持续深耕,多次在关键节点引领领域发展。
南京大学教授 · 通用视频理解大模型 InternVideo 技术负责人
师从汤晓鸥教授,香港中文大学多媒体实验室的视频方向开拓者
南京大学计算机系本硕;阿里巴巴业务中台履约负责人、华泰证券数据中台负责人,十余年大型系统研发与技术团队管理经验
小米汽车自动驾驶核心成员,负责感知与决策系统的工程化落地