学习资料
2026 夏季 InfiniTensor 训练营前沿模型 5:《多模态智能及其应用》

8 月 12 日,2026 夏季 InfiniTensor 训练营前沿模型第五课《多模态智能及其应用》正式开讲。
上一课《大模型自主智能体》讲解了单/多智能体、工具学习、Agent 协作框架。

本节课聚焦理解生成一体化多模态大模型,梳理其技术演进脉络、四大技术派系与工程落地案例 Nano Banana Pro。

Nano Banana Pro

现象级案例解析

  • ResNet 论文白板板书:英文拼写准确、框图逻辑严密
  • LLaVA-UHD v3 科普漫画:中文对白通俗、角色一致性强、文字渲染精准

Nano Banana Pro 的三大技术启示

1. 原生多模态框架

  • 拒绝拼凑:底层模型必须统一在同一表征空间
  • 以 Gemini 类多模态基础模型为底座,同步学习理解与生成

2. 上下文多模态思考

  • 超长上下文窗口支持:多图、多轮对话、长文本设定集
  • 从“一次性出图”进化为“对话式连续创作”

3. 高质量数据与评估体系

  • 角色一致性来源:海量优质图文交织数据
  • 主观指标(美感/还原度):系统化人类评估体系驱动
  • 客观指标(文字/布局):高效量化反馈机制

现有开源多模态生成模型

现有模型的困境

理想 vs 现实:一体化框架的核心矛盾

1. 编解码矛盾:AR 适合文本但图像生成不直观;Diffusion 适合图像但难做文本理解
2. 视觉特征矛盾:离散特征兼容 AR 但易退化;连续特征细节丰富但难与文本统一
3. 表示特性矛盾:语义特征对齐好但缺细节;细节特征逼真但难支撑语义理解

现有理解生成模型框架

  • 三维分析矩阵:解码方式(AR/Diffusion)× 视觉特征(连续/离散)× 表示特性(语义/细节)

派系一:生成式外挂派 AD-QC-LS(伪)

  • 代表工作:BLIP-3o, Qwen-Image
  • 核心思路:LLM 生成 Condition → 注入现成 Diffusion 模型
  • 优劣:快速具备能力;参数冗余、图文特征割裂

派系二:极致统一派

1. A-Q-L(EMU, Chameleon)

2. A-C-L(NextStep-1):VAE 保留细节,但语义理解弱、AR 解码不直观

3. A-Q-S(VILA-U):双任务优化统一特征,但 VQ 局限仍在

4. D-Q-L(LLaDA-V, MMaDA):采用扩散式语言/多模态建模范式;在生成过程中通过迭代去噪预测离散 token。

派系三:融合建模派(主流路线)

1. A-Q-LS(TokenFlow):CLIP+ViT 融合 VQ,适配 AR 但受限于离散化

2. A-QC-SL(Janus / BAGEL):特征解耦(独立 Expert + 共享 Attention),双 SOTA 但内生融合不足

3. AD-C-L(Transfusion):同一 Backbone 内 AR(文) + Diffusion(图)

4. AD-Q-SL(Show-o):CLIP-ViT + VAE 融合后 VQ 离散化 + Diffusion 解码,兼顾语义细节但仍受 VQ 限制

5. AD-QC-SL(Manzano、X-Omni、TAR):全维度融合(CLIP ViT 离散词表 + 外挂 Diffusion),能力强但结构冗余

6. AD-C-SL(Show-o2、Tuna):连续特征 + 语义细节融合 + VAE Decoder + Flow Matching,在论文报告的多项基准上取得较强性能

DeepMind 启发

从公开研究成果来看,连续视觉表示与 Diffusion/Flow Matching 是统一多模态生成的重要技术路线;

Nano Banana Pro 技术方案预判

以下内容为基于公开信息和现有研究路线的技术推测。

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流