
8 月 12 日,2026 夏季 InfiniTensor 训练营前沿模型第五课《多模态智能及其应用》正式开讲。
上一课《大模型自主智能体》讲解了单/多智能体、工具学习、Agent 协作框架。
本节课聚焦理解生成一体化多模态大模型,梳理其技术演进脉络、四大技术派系与工程落地案例 Nano Banana Pro。
Nano Banana Pro
现象级案例解析

- ResNet 论文白板板书:英文拼写准确、框图逻辑严密
- LLaVA-UHD v3 科普漫画:中文对白通俗、角色一致性强、文字渲染精准
Nano Banana Pro 的三大技术启示

1. 原生多模态框架
- 拒绝拼凑:底层模型必须统一在同一表征空间
- 以 Gemini 类多模态基础模型为底座,同步学习理解与生成
2. 上下文多模态思考
- 超长上下文窗口支持:多图、多轮对话、长文本设定集
- 从“一次性出图”进化为“对话式连续创作”
3. 高质量数据与评估体系
- 角色一致性来源:海量优质图文交织数据
- 主观指标(美感/还原度):系统化人类评估体系驱动
- 客观指标(文字/布局):高效量化反馈机制
现有开源多模态生成模型
现有模型的困境

理想 vs 现实:一体化框架的核心矛盾


1. 编解码矛盾:AR 适合文本但图像生成不直观;Diffusion 适合图像但难做文本理解
2. 视觉特征矛盾:离散特征兼容 AR 但易退化;连续特征细节丰富但难与文本统一
3. 表示特性矛盾:语义特征对齐好但缺细节;细节特征逼真但难支撑语义理解
现有理解生成模型框架
- 三维分析矩阵:解码方式(AR/Diffusion)× 视觉特征(连续/离散)× 表示特性(语义/细节)

派系一:生成式外挂派 AD-QC-LS(伪)

- 代表工作:BLIP-3o, Qwen-Image
- 核心思路:LLM 生成 Condition → 注入现成 Diffusion 模型
- 优劣:快速具备能力;参数冗余、图文特征割裂
派系二:极致统一派
1. A-Q-L(EMU, Chameleon)

2. A-C-L(NextStep-1):VAE 保留细节,但语义理解弱、AR 解码不直观

3. A-Q-S(VILA-U):双任务优化统一特征,但 VQ 局限仍在

4. D-Q-L(LLaDA-V, MMaDA):采用扩散式语言/多模态建模范式;在生成过程中通过迭代去噪预测离散 token。

派系三:融合建模派(主流路线)
1. A-Q-LS(TokenFlow):CLIP+ViT 融合 VQ,适配 AR 但受限于离散化

2. A-QC-SL(Janus / BAGEL):特征解耦(独立 Expert + 共享 Attention),双 SOTA 但内生融合不足

3. AD-C-L(Transfusion):同一 Backbone 内 AR(文) + Diffusion(图)

4. AD-Q-SL(Show-o):CLIP-ViT + VAE 融合后 VQ 离散化 + Diffusion 解码,兼顾语义细节但仍受 VQ 限制

5. AD-QC-SL(Manzano、X-Omni、TAR):全维度融合(CLIP ViT 离散词表 + 外挂 Diffusion),能力强但结构冗余

6. AD-C-SL(Show-o2、Tuna):连续特征 + 语义细节融合 + VAE Decoder + Flow Matching,在论文报告的多项基准上取得较强性能

DeepMind 启发

从公开研究成果来看,连续视觉表示与 Diffusion/Flow Matching 是统一多模态生成的重要技术路线;
Nano Banana Pro 技术方案预判

以下内容为基于公开信息和现有研究路线的技术推测。
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

