一、模型架构

在这里插入图片描述
保持不变,依然是VIT+MLP+LLM。不过这次竟然有gpt-oss,这也太快了。
FLASH版本引入了视觉分辨率路由器VIR,从语义而不是图像的高宽上选择分辨率,作用是加快了推理速度。具体是针对每个patch,评估语义丰富度选择压缩率,进行像素混洗。说可以减少一半的视觉token。

使用Qwen3系列和GPT-OSS初始化语言模型,使用InternViT-300M和InternViT-6B初始化视觉编码器。

二、训练阶段

在这里插入图片描述

1.预训练

训练目标:NTP损失。对话仅使用响应标记计算损失,同时使用平方平均加权损失,避免长度敏感。更新所有参数。

数据:
多模态数据:基于InternVL3的训练语料,类型包括图像字幕、一般问答、数学、科学学科、图表、OCR、知识链接、文档理解、多轮对话和医疗数据等多个领域。
纯文本数据:InternLM系列的数据,
总体上,预训练语料库包含大约1.16亿个样本,对应约250B个标记。纯文本和多模态数据的比率约为1:2.5。最大序列长度设置为32K标记,以适应长上下文理解和推理。

2.后训练

(1)SFT

训练目标:同样是NTP,使用平方平均方法计算损失,上下文窗口也是32K。
使用了更高质量、多样化的训练数据:InternVL3的指令遵循数据;多模态推理数据;agent类工具调用数据。

重点看多模态推理数据的构建:利用一个大规模推理模型来采样具有详细推理过程的展开情况。除了验证答案是否事实正确外,我们还对推理过程本身实施了严格的过滤措施:这包括评估思考的清晰程度,剔除冗余内容,并确保格式保持一致。

(2)级联强化学习

强化学习(RL)的核心优势在于其能够引入负样本,这可以剪除模型输出空间中的低质量区域,从而提升整体响应质量。

RL可以分为离线和在线方法,从样本来源上区分。为了结合二者的优势,首先使用一个离线RL算法MPO对模型进行微调,作为一个高效的热身阶段以达到满意的结果,这可以为后续阶段保证高质量的回滚。随后,我们采用一个在线RL算法GSPO,基于模型自身生成的回滚进一步精细化输出分布。

MPO:混合偏好优化

损失名称论文里叫对应经典算法通俗解释
偏好损失CpDPO 损失(Direct Preference Optimization)“人类更喜欢的回答” vs “不喜欢的回答”,拉大它们的差距
质量损失CqBCO 损失(Behavior Cloning Optimization)让模型模仿高质量示范数据,别跑偏
生成损失CgLM 损失(Language Modeling)让模型说话仍像正常语言模型,不胡言乱语

GSPO

特性/算法GSPOGRPO
奖励处理标准化奖励,通过比较同一查询中抽样的响应之间的奖励来定义优势通常不涉及标准化奖励,直接使用原始奖励进行优化
训练目标通过最小化重要性采样比率和标准化奖励的乘积来优化策略直接优化策略以最大化累积奖励
重要性采样比率使用,定义为每个标记比率的几何平均值通常不使用
策略更新基于重要性采样比率和标准化奖励的梯度更新基于累积奖励的梯度更新
应用场景在线强化学习,特别是在训练密集型和专家混合(MoE)模型方面更为有效通用的策略优化,适用于多种强化学习环境
优势通过标准化奖励和重要性采样比率更好地处理在线强化学习中的奖励信号更直接地关注于最大化累积奖励,实现策略优化

在这里插入图片描述
级联强化学习(离线-MPO → 在线-GSPO)相比「直接用单一 RL 范式」的三大优势,一句话总结就是:

  1. 更稳:离线阶段把「采样」和「更新」解耦,抑制奖励操纵;在线阶段继承 MPO 的好起点,训练动态更稳定、对超参数更不敏感。
  2. 更快:MPO 阶段多个模型共用同一批离线数据,省掉大量在线采样开销。
  3. 更高:MPO 先把模型拉到较高水平,后续 GSPO 只需更少步数就能冲到更高性能,整体训练成本进一步降低。
(3)视觉一致性训练

主要是为了得到FLASH版本。
第一阶段:一致性训练。核心目标是让模型在处理不同压缩率的视觉标记时,输出分布保持一致,从而在压缩视觉信息时不显著损失性能。

  • 训练逻辑:通过训练使整个模型最小化基于不同压缩率视觉标记的响应分布差异。这里引入一个额外的参考模型(用 InternVL3.5 初始化并冻结),作为 “标准” 输出的基准。
  • 输入设置:对于每个样本,图像块会被随机压缩为两种形式 ——256 个标记(压缩率 ξ=1/4)或 64 个标记(压缩率 ξ=1/16)。参考模型始终以 256 个标记(ξ=1/4)进行推理,作为对比基准。
  • 损失函数:通过计算参考模型输出分布与当前训练模型(处理不同压缩率视觉标记时)输出分布的 KL 散度(KL divergence),并取平均值作为损失(LViCO),迫使模型在不同压缩率下的输出尽可能接近。

第二阶段:路由器训练。核心是让 ViR 学会为不同输入选择合适的权衡分辨率。

训练目标:训练 ViR 作为二元分类器,依据输入选择合适的压缩率,通过标准交叉熵损失进行训练。
路由目标构建:先计算模型在未压缩视觉标记(每块 256 个标记)和压缩视觉标记(每块 64 个标记)条件下输出的 KL 散度,以此衡量压缩对输出的影响。
关键计算:
计算每个图像块的损失比率r_i,量化因压缩视觉标记导致的损失相对增加。
基于r_i定义二元真实标签y_{router}^i:当r_i < τ(压缩影响可忽略)时为 0,对应压缩率1/16;当r_i ≥ τ(压缩影响显著)时为 1,对应压缩率1/4。
训练细节:主多模态语言模型(MLLM)冻结,仅训练 ViR;τ是基于滑动窗口历史r_i值的第 k 百分位数计算的动态阈值,且目标分布保持平衡。

(4)数据

数据集包含大约5600万个样本,相当于约1300亿个标记。纯文本数据与多模态数据的比例大约为1:3.5。

论文地址

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐