物理驱动的
自进化视频大模型

视觉化为洞察;看见成为理解;理解引导行动;行动导致进化;进化形成智能。

Technology Trend

从符号到视频,
从静态到演化

三代智能范式的分野,不在模型有多大,而在两件事:学的是什么,以及怎么学。

上一代

大语言模型

符号世界

核心表征符号
学习方式大规模离线
  • 知识覆盖广,语言与逻辑推理成熟
  • 世界经文本二次编码,物理细节大量丢失
  • 训练完成即定型,不因被使用而增长
当前

视频 / 视觉模型

像素世界

核心表征视频
学习方式大规模离线
  • 直接以像素为输入,保留时空连续性
  • 仍是「一次训练、长期不变」的离线范式
  • 部署后不吸收现场反馈,长尾靠人工重训
我们的路线

自进化视频模型

物理世界 · 在线演化

核心表征视频
学习方式反馈驱动
  • 保留对物理世界的原生表达
  • 场景反馈驱动自动评测与迭代
  • 能力在闭环中持续累积 —— 越用越强
Positioning

不在应用层竞争,
在范式层做原创

不做又一个视频生成工具,也不做机器人本体 —— 我们做的是让视频模型自己变强的方法。越往底层,越是原始创新。

应用层

影视剪辑工具 · 安防与合规分析 · 机器人本体与系统集成

参与者众多 · 同质化竞争

现有基础模型层

大语言模型 · 视频生成模型 · VLA 模型 —— 沿用「一次训练、长期不变」的离线范式

巨头与独角兽的主战场

自进化视频模型

让模型在真实场景的反馈中自动评测、自我迭代 —— 改动的是学习范式本身

目前空白 · 我们在这一层

01为什么这一层是空白

做视频生成的只追求画质与时长;做具身的聚焦本体与控制,模型靠外购;做语言的隔着符号,看不见物理世界。自进化视频模型落在所有人的边界之外。

02为什么是我们能做

VideoMAE / InternVideo 开创了视频自监督预训练流派,后被图灵奖得主杨立昆团队的 V-JEPA 系列跟随验证;VideoChat-R1 已把强化学习引入视频理解,「自评测—自迭代」链路在我们手里跑通。

03为什么是现在做

四层能力的技术积累均已就位,接入自进化范式即可完成收敛。模型能力正处在临界点上 —— 突破随时可能发生,窗口就在当下。

Architecture

四层能力,
一个自进化闭环

自下而上构成能力栈:从看懂世界,到理解与预测,再到决策执行,最终由真实反馈驱动自我进化。

LAYER 01

感知层

表征 → 建模 → 重建

把原始视频转为可计算的时空表征,进而建模并重建三维场景。

VideoMAE · InternVideo
对标图灵奖得主的 V-JEPA 路线

LAYER 02

认知层

记忆 · 推理 · 预测

跨长视频保持上下文一致,推理事件因果并预测下一步状态。

VideoChat3
StreamForest 记忆 + Video-o3 推理

LAYER 03

执行层

决策 · 规划 · 执行

把理解转化为可执行的动作序列,驱动物理世界中的设备完成任务。

P-WAM 世界-动作模型
多项指标领先主流 VLA 与 WAM

LAYER 04

进化层

自评估 · 自迭代 · 自进化

用应用侧回流的真实反馈自动评测与迭代,模型能力随业务持续增长。

VideoChat-R1 · VideoCap-R1
通用奖励模型驱动的自主进化

四层能力对外输出 场景落地产生真实反馈 反馈回流至进化层 四层能力同步升级,反哺全部场景
Products

一套底座,
三个产品

同一套自进化视频模型底座,按三类空间封装成三个产品 —— 研发投入一次,三个行业同时受益。

PRODUCT 01

视频管理与创作平台

纯数字空间 · 媒体与内容

  • 自然语言检索视频片段,精确到秒
  • 自动语义标注、高光检测与智能集锦
  • 长视频问答与摘要,答案带时间戳
  • 内容审核辅助与二次创作素材推荐

交付形态

云端 API · 私有化部署 · 联合研发

PRODUCT 02

智能制造视频理解引擎

数字物理融合 · 智能制造

  • 把术语、作业规程与专家标注注入模型
  • 识别操作步骤并与标准规程比对
  • 少量样本即可适配新的专业领域
  • 面向业务的专业视频问答与合规告警

交付形态

私有化部署为主(数据不出厂)

PRODUCT 03

具身垂域模型平台

纯物理空间 · 机器人

  • VLA 模型复现、调优与泛化增强
  • 面向真机的模型评测与验证
  • 自研 P-WAM 世界-动作模型
  • 训推一体平台,支撑训练评测与真机验证

交付形态

模型授权 · 私有化部署 · 联合研发

Track Record

十余年视频理解积累,
已在头部厂商反复验证

从动作识别的奠基之作,到被国际大厂采用的通用视频大模型 —— 每一层能力都有公开可查的成果支撑。

TSN · 2016

6,954 次引用

谷歌学术;ECCV 过去 5 年引用 Top10 论文,至今仍是动作识别的标准基线

VideoMAE · 2022

800 万次下载

首个被 Hugging Face 收录的视频 Transformer 模型;NeurIPS 2022 最具影响力论文

InternVideo · 2022–25

60 项任务领先

首个通用视频理解大模型,被 NVIDIA Cosmos 世界模型平台采用

Team

一支长期主义
视频理解团队

从 2014 年至今,在视频理解这条赛道上持续深耕,多次在关键节点引领领域发展。

王利民
首席科学家

王利民

南京大学教授 · 通用视频理解大模型 InternVideo 技术负责人

师从汤晓鸥教授,香港中文大学多媒体实验室的视频方向开拓者

5 万+谷歌学术论文总引用
100+IJCV / TPAMI / CVPR 论文
全球第一视频理解方向引用量
2030国家人工智能重大项目主持
韦永壮
创始人 / CEO

韦永壮

南京大学计算机系本硕;阿里巴巴业务中台履约负责人、华泰证券数据中台负责人,十余年大型系统研发与技术团队管理经验

LTX
联合创始人 / CTO

刘同学

小米汽车自动驾驶核心成员,负责感知与决策系统的工程化落地

以原创的自进化视频技术
引领下一代人工智能的演进

无论你是想接入视频理解能力,还是在具身智能上寻找模型伙伴 —— 我们都想和你聊聊。