图片

本文约6500字,建议阅读13分钟
多模态模型 Keye-VL-1.5 凭三核心创新提升视频理解,基准测试与实践效果佳。

近年来,大型语言模型(LLM)的发展浪潮席卷全球,其强大的理解和生成能力不断刷新着人们对人工智能的认知。自然而然地,研究者们开始尝试将这种能力延伸到视觉领域,于是多模态大语言模型(MLLM)应运而生,让AI不仅能读懂文字,还能“看懂”图片和视频。

然而,在诸多视觉任务中,视频理解始终是一座难以逾越的高峰。与静态图片不同,视频是动态的、信息高度密集的。模型不仅要理解每一帧的画面内容(空间信息),还要把握帧与帧之间的变化与联系(时间信息)。这就带来了一个根本性的矛盾:计算资源是有限的,到底是追求更高的画面分辨率来看清细节,还是处理更多的帧数以捕捉动态?现有模型通常采用均匀采样固定数量、降低分辨率的帧来处理视频,这种“一刀切”的方式往往导致在需要细粒度细节或长程时序推理的任务上表现不佳。

图片

  • 论文:Kwai Keye-VL 1.5 Technical Report

  • 链接:https://arxiv.org/pdf/2509.01563

针对这一核心挑战,快手的Keye团队提出了 Keye-VL-1.5。这篇技术报告详细阐述了一个拥有8B参数的多模态基础模型,它通过三项关键创新,在视频理解方面实现了突破性进展,同时在通用的视觉-语言任务上保持了强劲竞争力。简单来说,Keye-VL-1.5试图教会AI更“聪明”地看视频:该细细品味的关键帧就放大看,那些变化不大的过渡帧就快速浏览,从而在有限的资源下实现最佳的理解效果。接下来,我们将深入解读这项工作的技术细节与卓越成果。

图片

核心创新一:Slow-Fast视频编码策略

Keye-VL-1.5采用经典的多模态大语言模型架构,由三个核心组件构成:视觉Transformer(ViT)、MLP投影器和语言解码器。该模型使用SigLIP-400M-384-14作为视觉编码器,Qwen3-8B作为语言解码器。

视频理解的核心困境在于“时空权衡”(Spatio-Temporal Trade-off)。高分辨率处理每一帧会耗尽计算资源,无法处理长视频;而为了覆盖更长的时间,降低分辨率或减少帧数又会丢失细节或关键动态信息。Keye-VL-1.5的创新始于一个直观的观察:一段视频中,并非所有帧都同等重要。相邻帧往往非常相似,只有发生显著变化(如场景切换、物体移动)的“关键帧”才承载着大部分信息量。

受生物视觉系统(如人眼)和经典视频识别模型的启发,Keye-VL-1.5设计了一种Slow-Fast(慢-快)视频编码策略。该策略动态地将输入的视频帧划分为两类,并分别处理:

1、Slow Pathway(慢路径):负责处理“关键帧”。这些帧具有较高的空间分辨率,模型能从中提取丰富的视觉细节。但处理的帧数较少。

2、Fast Pathway(快路径):负责处理“过渡帧”。这些帧之间的变化很小,因此被以较低的空间分辨率处理,但时间覆盖率更高(即处理更多的帧),用于捕捉细微的运动和时序信息。

那么,如何自动区分快慢帧呢?


模型使用了一个基于图像块的相似度函数。流程如下:

  • 第一帧总是被标记为Slow帧。

  • 对于后续每一帧,计算其与上一个Slow帧的相似度。

  • 如果相似度高于95%,则认为此帧内容变化不大,将其标记为Fast帧。

  • 如果相似度低于95%,则意味着出现了显著视觉变化,将此帧标记为一个新的Slow帧。

实现细节与资源分配:


为了平衡帧数和总token预算(LLM侧视觉token总数限制,如Keye-VL-1.5为75k),团队为每个Fast帧分配仅相当于Slow帧30%的token预算。之后,使用二分搜索法精确计算在总token预算内,每个Slow帧能分配到的token数,从而最大化利用资源。

图片

此外,为了帮助模型更好地学习时间信息,在输入中引入了特殊token和绝对时间戳,明确标识出哪些token属于Slow帧,哪些属于Fast帧以及它们对应的时间点。

这项创新的精髓在于 “按需分配”计算资源。它不再对视频进行粗粒度的均匀压缩,而是根据视频内容本身的信息密度进行自适应的、细粒度的编码,从根本上优化了时空权衡问题。

核心创新二:渐进式四阶段预训练与超长上下文扩展


构建一个强大的MLLM并非一蹴而就。Keye-VL-1.5采用了一个精心设计的四阶段渐进式预训练流程,如同搭建一座高楼,从地基到主体结构逐步完成。

图片

阶段一:跨模态对齐(Cross-Modal Alignment)


为了让视觉编码器(ViT)和语言解码器(LLM)能“说同一种语言”。即在投影层(MLP)建立视觉特征与语言语义之间的稳健映射。 这里采用冻结ViT和LLM的参数,仅训练连接它们的MLP投影层。使用海量的图像-文本对数据,让模型学习将视觉信号投射到语言模型能够理解的语义空间。

阶段二:多任务预训练(Multi-task Pre-training)


为了在对齐的基础上,让模型学习执行各种各样的视觉-语言任务,打下全面的能力基础。 这里采用解冻所有模型参数,进行端到端训练。数据包括图像描述(Captioning)、光学字符识别(OCR)、视觉问答(VQA)、目标定位(Grounding)以及交错图文数据等。此阶段模型上下文长度限制为8K token。

阶段三:退火(Annealing)


第二阶段使用了大量数据,但数据质量参差不齐。本阶段使用精选的高质量数据对模型进行精调,提升其理解的精细度和准确性。关键:扩展上下文至128K! 这是本阶段的重头戏。为了处理长视频和长文档,团队将模型的上下文长度从8K扩展到128K token。这涉及:

  • 将LLM中RoPE位置编码的逆频率(inv_freq)从1,000,000重置为8,000,000以适应更长的序列。

  • 引入上下文并行(Context Parallelism) 和流水线并行(Pipeline Parallelism) 等新的并行策略来支持超长序列训练。

  • 数据混合比例优化:最终确定24%的token分配给视频,50%给图像,26%给文本,在视觉和文本能力间取得最佳平衡。

阶段四:模型融合(Model Fusion)


将通过不同数据混合训练得到的多个专家模型进行融合,集各家之长,进一步提升模型的鲁棒性并减少偏差。

这种渐进式的训练策略体现了深刻的工程智慧。它先对齐、后学习、再精炼、最终融合,每一步都为下一步打下坚实基础,确保了训练过程的稳定性与最终模型能力的全面性。特别是128K上下文的支持,为模型处理长视频、进行复杂推理提供了至关重要的舞台。

核心创新三:全面的后训练流程(推理增强与人类偏好对齐)


预训练得到了一个能力全面的“基础模型”,但要让它成为一个“专家”,还需要进行精细化的后训练(Post-Training)。Keye-VL-1.5的后训练流程是一个极其复杂的系统工程,专注于两个终极目标:增强复杂推理能力和对齐人类偏好。

图片

1. 非推理阶段:SFT + MPO


  • SFT(监督微调): 使用超过750万个高质量的多模态问答样本对模型进行微调。这些数据通过专有的TaskGalaxy框架构建,覆盖7万种任务类型,并注重任务多样性、挑战性和可靠性。

  • MPO(混合偏好优化): 在SFT之后,使用MPO算法进一步优化模型。通过从模型采样结果中构造“好-坏”样本对,训练模型区分响应质量,使其输出更符合人类偏好。

2. Keye奖励模型(Keye-Reward Model)


一个高质量的奖励模型是后续强化学习(RL)的“裁判”。它用于评估模型响应的好坏,为RL提供奖励信号。

本文的方法基于Keye-VL-Preview模型微调而来。其输入是查询(Query)和两个候选响应(Response A/B),输出是对这两个响应质量的判断。它支持两种推理模式:

  • no_think模式:直接输出最终判断。

  • think模式:先根据9个维度(如可信度、正确性、冗余度等)分别评估两个响应,再给出综合判断。这种“混合推理”模式提升了评估的准确性和可解释性。

3. LongCoT冷启动(Long Chain-of-Thought Cold-Start)


为模型注入强大的长链推理(LongCoT) 能力,为后续的RL训练提供一个高水平的起点(Cold-Start Model)。

构建高质量的CoT数据极其困难。Keye团队设计了一个五步自动化流水线来生成这些数据:

图片

  1. 多源数据收集与增强:收集数学、STEM、OCR等领域的复杂问题,并用MLLM进行问题改写和任务合并,增加难度和多样性。

  2. 多路径推理生成与置信度量化:使用多个MLLM为每个问题生成多条推理链,并计算每一步的置信度,作为质量评估的依据。

  3. 两级质量评估:从答案正确性推理过程有效性两个层面,用MLLM作为裁判对生成的推理链进行严格评估,并分为三类:

  • A类(高质量):答案和推理都正确。

  • B类(中等质量):答案正确但推理过程有问题。

  • C类(低质量):答案错误或推理严重缺陷,直接丢弃。

  1. 人工增强循环:对于B类和有冗余嫌疑的A类样本,引入人工进行修正和优化,提升推理链的逻辑性和简洁性。

  2. 动态质量评分与数据利用:对最终样本进行1-5分的质量评分(5分代表需要高度多模态和因果推理的难题)。高分样本在训练中会被重复使用,以强化高质量的推理模式。

4. 迭代式通用RL(Iterative General RL)


在冷启动模型的基础上,使用强化学习进一步锤炼模型的推理能力。 这里采用GSPO(组序列策略优化) 算法进行RL训练。GSPO的核心思想是基于序列级别的重要性权重进行优化,其目标函数如下:

  • 其中, 是第i个响应在组内的优势函数估计,衡量它相对于平均回报的好坏。

  •  是重要性比率,表示新策略生成该序列的概率与旧策略的概率之比。

  • 这个公式确保了策略更新的稳定性,避免了一次更新太大步幅而破坏现有能力。

渐进式提示采样(Progressive Hint Sampling):RL训练中,模型总会遇到一些难以解决的“硬样本”。为了充分利用这些样本,团队设计了5级提示系统,从抽象到具体逐级提供帮助:

图片

  • L1(概念/观察):提示核心概念或图像关键特征。

  • L2(策略/方法):建议可能的解决策略。

  • L3(工具/公式):提供可能需要的具体公式或定理。

  • L4(步骤/计算):给出第一步具体计算步骤。

  • L5(完整答案):提供标准答案。

对于每个硬样本,从低级提示开始尝试,直到模型能凭借某一级提示解决问题。该提示级别即为“最小必要信息”,基于此生成的响应被用来更新策略,高效地提升了模型解决难题的能力。

迭代增强循环:这是一个“冷启动模型”和“RL模型”相互促进的迭代过程:

  • 用冷启动模型初始化,进行General RL训练。

  • 用RL模型对冷启动数据集进行拒绝采样,如果采样结果比原答案好,就用新答案替换旧答案,更新数据集。

  • 用更新后的数据训练一个新的、更强的冷启动模型。

  • 用新的冷启动模型筛选RL数据集,选择难度适中的样本进行下一轮RL。

这个过程不断循环,使得模型能力迭代上升。该图展示了拒绝采样带来的性能提升。

图片

5. 对齐RL(Alignment RL)


为了让模型在真实应用场景中更实用、更可靠,专注于:

  • 指令遵循(Instruction Following):严格按用户要求的内容、格式、长度输出。

  • 格式遵守(Format Adherence):严格遵守指定的输出格式(如think/no_think)。

  • 偏好对齐(Preference Alignment):使开放域问题的回答更可靠、互动性更好、风格更喜闻乐见。

本文设计了奖励系统设计:结合了三种奖励:

  • 规则奖励(Rule-Based):检查响应是否符合预定义的结构和格式规则。

  • 生成奖励(Generative):对于有标准答案的任务,指令MLLM评估响应与答案的匹配度、推理一致性等。

  • 模型奖励(Model-Based):对于无标准答案的任务,用奖励模型直接评估响应是否符合人类偏好。

另外,本文为指令遵循、推理、RAG(检索增强生成)等任务构建了专门的训练数据。

Keye-VL-1.5的后训练流程是其卓越性能的关键所在。它不再是简单的微调,而是一个数据构建、模型训练、评估迭代紧密耦合的复杂生态系统。尤其是LongCoT数据构建、迭代式RL以及渐进式提示采样,体现了团队在如何高效提升模型推理能力方面的深刻洞见和工程创新。

训练基础设施优化


训练如此庞大的模型需要强大的工程支持。Keye团队对训练基础设施进行了深度优化,解决了三大挑战:

异构混合并行策略 (Heterogeneous Hybrid Parallel Strategy) :


由于ViT和LLM的计算特性和资源需求差异巨大。对它们使用统一的并行策略会导致严重资源浪费。 这里采用:

  • 对计算模式相对固定的ViT,仅使用数据并行(DP) 来最大化吞吐量。

  • 对参数量和内存需求极高的LLM,采用流水线并行(PP)、张量并行(TP)和数据并行(DP) 相结合的混合策略。

这种量身定制的策略是成功进行128K超长序列训练的决定性技术前提。

动态负载均衡机制 (Dynamic Load Balancing Mechanism) :


多模态数据(如图片vs.高清视频)的计算负载差异巨大,在数据并行中会导致某些GPU提前完成工作并空闲等待,降低效率。 这里采用预先估算每个样本的计算时间复杂度,然后使用贪心算法将样本分配到不同的GPU上,使得所有GPU完成一个训练步的总时间大致相等,从而大幅提升硬件利用率。

灵活可扩展的数据加载器 (Flexible and Scalable Dataloader) :


因为海量多媒体数据的I/O容易成为瓶颈。 这里创新性的采用:

  • 数据加载器深度感知并行训练拓扑,在不同并行维度下智能地加载和分发数据。

  • 引入I/O服务器架构,将视频解码等CPU密集型任务从训练节点卸载,有效解决了复杂媒体处理带来的CPU瓶颈。

  • 实现了样本级完美恢复机制,训练中断后可以从最后一个成功处理的样本无缝恢复,极大提升了大规模训练的稳定性和效率。

没有强大的工程实现,再优秀的算法设计也无法落地。这些基础设施优化确保了Keye-VL-1.5的训练能够高效、稳定地进行,是模型成功不可或缺的基石。

综合评估与结果分析


团队对Keye-VL-1.5进行了极其全面和严格的评估,包括内部测试和大量公开基准测试。

1. ViT零样本分类能力验证


首先,团队验证了其经过继续预训练的原生分辨率ViT的图像编码能力。如表2所示,在加入2D RoPE后,其零样本分类能力与原始SigLIP基线模型相比具有竞争力,在某些数据集(如ImageNet-A, ObjectNet)上甚至表现更好,证明了其视觉编码器的有效性。

图片

2. Slow-Fast编码策略有效性讨论


与采用2D卷积合并帧技术的Qwen-2.5-VL相比,Keye-VL-1.5-Base(预训练模型)在VideoMME基准上展现了显著优势。图7表明,Keye模型在更多帧数下(384帧)才达到性能峰值,而Qwen在128帧后性能就开始下降,这说明Slow-Fast策略能让LLM更有效地整合多帧信息。同时,Keye的token使用策略更灵活,在帧数少时用更多token看细,帧数多时用更少token高效浏览, computational resource利用效率更高。

图片

3. 公开基准测试:全面领先的性能


Keye-VL-1.5在Thinking模式下与同类最先进模型(如Qwen2.5-VL-7B, InternVL3-8B, MiMo-VL-7B)以及闭源模型(GPT-4o, Claude-3.7-Sonnet)进行了全面对比。

图片

  • 通用VLM任务: 在大型综合基准OpenCompass、MMMU、AI2D、MMBench、MMStar上,Keye-VL-1.5均取得了最佳或接近最佳的成绩,综合表现领先。

  • 视频任务: 这是Keye-VL-1.5的核心优势领域。在Video-MME、Video-MMMU、TempCompass等所有视频基准上,它都显著超越了其他开源模型,尤其在Video-MMMU上取得了6.5%的绝对提升

  • 数学推理任务: 表现大幅优于Qwen和InternVL,与专门强化数学能力的MiMo-VL相比各有千秋,整体处于同一梯队。

4. 内部基准测试:更贴近实际的评估


由于公开基准存在任务覆盖窄、问题过于简单、格式限制多、数据污染风险等问题,团队构建了一个更 rigorous 的内部视频评估基准。它包含8个核心维度(视觉元素识别、推理能力、时序信息理解等),采用5分制评分和GSB(好/相同/坏)偏好选择两种方法,由多名标注员进行细致评估。

图片

图片

  • 关键结果一: Keye-VL-1.5-8B相比Preview版本取得了全面的巨大提升(总体+0.51),尤其在正确性(+0.57)和推理能力(+1.00)上进步惊人。

  • 关键结果二: Keye-VL-1.5-8B的总体表现(3.53)优于强劲对手MiMoVL-7B-RL-2508(3.40),主要在正确性鲁棒性上优势明显(+0.83!)。虽然在语言流畅性和创意上稍逊,这体现了Keye更侧重于准确性和可靠性。

5. 消融研究


通过消融实验,团队验证了每一步训练的有效性:

图片

  • SFT/MPO/LongCoT冷启动: 增加高质量SFT数据、引入MPO、以及最重要的LongCoT冷启动,都带来了持续的性能增益。

  • 专家模型与模型融合: 以OCR任务为例,训练专门的OCR专家模型并将其与基础模型融合,能显著提升在特定领域(如车牌、印章识别)的性能,且整体性能超过其他模型。

  • 对齐RL的有效性: 对齐RL训练后在指令遵循和数学推理任务上均取得了一致提升。

  • 部分解决方案(提示)的影响: 在RL阶段使用渐进式提示为硬样本提供“部分解决方案”,能有效提升采样成功率和最终模型性能。

  • 拒绝采样的影响: 通过拒绝采样进行迭代训练(RFT-RL)相比直接RL能带来显著的性能增益。

图片

图片

看几个案例


报告通过几个生动案例展示了模型的实际能力:

视频时序定位:在一个26秒的视频中,模型能精准定位到一个仅出现约2秒的手袋的时间范围(22.3s-23.8s),精度达0.1秒。

图片

复杂行为推理:模型能理解视频中“大狗轻咬小狗耳朵”这一行为的深层含义是“纠正小狗偷食餐桌食物的不当行为”,并关联视频标题进行合理解释。

图片

细粒度场景描述:对于森林中降冰雹的复杂场景,模型能生成极其详细、准确的场景描述(潮湿环境、石阶、苔藓、光线、雾气),尽管未能识别出“冰雹”,但其整体描述已非常接近人类水平。

图片

这些案例证明Keye-VL-1.5不仅 benchmark 分数高,更具备了实用、细腻、可靠的视频理解与推理能力。

来个小结


Keye-VL-1.5技术报告展示了一项在视频理解领域意义深远的工作。它的核心贡献可总结为三点:

  1. 创新的Slow-Fast视频编码架构:它聪明地解决了视频理解中的根本矛盾——时空权衡,通过动态分配计算资源,为高效且精准的视频处理提供了新范式。

  2. 系统性的训练策略:从渐进式预训练到全面且迭代的后训练流程,这套方法论不仅成功地打造了一个强大的模型,更为社区提供了如何系统化构建下一代MLLM的宝贵蓝图,特别是在提升复杂推理能力和对齐人类偏好方面。

  3. 卓越的综合性能:大量实验证明,Keye-VL-1.5在视频理解任务上树立了新的技术标杆,同时在通用多模态任务上保持了顶尖竞争力,实现了其设计目标。

这项研究的价值不仅在于产出了一个高性能模型,更在于其工程实践上的卓越成就和对未来研究方向的启示。它表明,通过精巧的算法设计、系统性的训练流程和强大的工程实现,AI模型在理解动态视觉世界方面正在不断逼近人类水平。

展望未来,Keye-VL-1.5的方向可能会向着更长上下文、更高效编码、更复杂因果推理以及与具体应用(如短视频内容生成、自动化审核、智能教学等)的更深度结合发展。

编辑:于腾凯

校对:丁玺茗

关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。

图片

新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐