这项由伊利诺伊大学厄巴纳-香槟分校与微软研究院联合开展的研究,于2026年7月30日以预印本形式发布于arXiv平台,编号为arXiv:2607.28627。研究团队还有来自谷歌DeepMind的参与者,有兴趣深入阅读完整论文的读者可通过上述编号检索原文。
**当AI面对一部"大海捞针"的电影**
假设你是一位助理,老板丢给你一个装有一千张照片的硬盘,然后问你:"里面有没有一张带奶牛的图?"你会怎么做?大多数人都会快速翻看每一张图,一旦看到奶牛就停下来报告。这件事对人类来说并不难,但对现在的AI视觉语言模型来说,却是一个让它们头疼不已的问题。
更复杂的情形还在后面。如果老板给的不是一千张静态图片,而是一部长达两小时的视频,里面有数以千计的画面,而关键信息只藏在其中的几秒钟里,AI又该怎么办?这正是本篇研究要解决的核心难题。研究团队将这种挑战比喻为"视觉干草堆里找针",而他们的解决方案,就是一个被称为**ReToken**的神奇"小令牌"。
一、问题的根源:AI的眼睛为何会"走神"
现代的视觉语言模型(可以简单理解为能看图、看视频并回答问题的AI)在处理短内容时表现得相当出色。但一旦输入的图片数量变多、视频变长,它们的表现就会急剧下滑。这背后有两个互相纠缠的原因。
第一个原因是**计算资源的硬限制**。AI处理视觉内容时,每一帧画面都会被切成几百个"视觉片段"(专业上叫做视觉令牌),每个片段都需要占据显卡内存。一部两小时的视频,按照每秒半帧的速度采样,就会产生数万个这样的片段。要把它们全部塞进一块显卡同时处理,就像试图把整座图书馆的书同时摆在一张小书桌上——根本放不下。
第二个原因更为微妙,也是这项研究真正想深挖的:即便强行把所有内容都塞进去,AI也无法准确地"看到"那些真正重要的画面。研究团队做了一个实验,他们让AI观看一段含有约120帧画面的视频,然后分析AI内部"注意力"信号对每一帧的关注程度。按照直觉,AI应该对包含答案的那几帧给予更高的关注度。然而实验结果令人沮丧——整段视频的关注度曲线就像随机噪声,完全看不出任何规律,相关帧和无关帧的得分几乎一样混乱。
这个问题的根源在于:这类AI模型在训练时,输入的图片和视频几乎都是和问题高度相关的。换句话说,AI从来没有被训练过"在一堆不相关内容中找到有用的那个",所以它的注意力系统根本没学会做这件事。研究团队测量发现,基于这种注意力信号的检索方法,在长视频问答任务中每层的平均准确率(Recall@1)只有5.1%,而ReToken方法达到了18.4%,提升了三倍以上。
二、旧方案的思路与它的死穴
在ReToken出现之前,研究界已经有人意识到这个问题,并提出了一些应对策略。其中最直接的一种叫做**注意力检索**(以ReKV方法为代表):既然AI内部有注意力信号,那就用这个信号来判断哪些画面更重要,优先保留那些得到高关注的帧,抛弃其余的。
这个思路并非完全没道理,但它有一个根本性的死穴。注意力机制的本质是"哪些内容应该被融合进当前的输出",它服务于下一个词的预测,而不是服务于"找出最相关的图片"这件事。打个比方,这就好像你让一个厨师用鼻子判断哪锅汤的温度最高——鼻子能感知到蒸汽,但这并不是测量温度最精准的工具,用温度计才是正道。
研究团队还尝试了另一个更聪明的改进:与其用注意力信号,不如改用AI内部另一种叫做**"值向量"(Value Vector)**的东西。在AI的注意力机制里,每个"令牌"不仅有决定"谁关注谁"的键(Key)和查询(Query),还有一个实际携带内容信息的值(Value)。研究者发现,值向量更像是一个内容指纹,它记录的是这个画面"贡献了什么内容",而键查询对只是在决定"内容如何被分配"。
实验数据证实了这个发现。在一个只有两张图片的简单测试中,如果用一个精确的目标短语(比如"一头奶牛")去和每张图片的平均值向量比较相似度,找到正确图片的准确率在Qwen3VL模型上达到78.0%;而用传统的键查询方式,准确率只有65.7%。在另一个InternVL3.5模型上,这个对比是83.8%对78.8%。值空间明显更好用。
然而,新的问题随之而来。值空间虽然更精准,但它对输入的查询文本极其敏感——精确的目标短语效果好,但如果把整个问题句子的所有词取平均值来查询,反而会引入太多噪声,抵消掉值空间的优势,结果甚至变得更差。问题的本质变成了:谁来提供那个"足够精准的查询向量"?
三、ReToken的诞生:一个专门"找东西"的学习型令牌
ReToken的核心想法可以用一个比喻来理解。假设你家里来了一位擅长找东西的助手,每次你告诉他"我想找带奶牛的图",他不会机械地把你说的每个字的意思平均混合,而是会综合理解你的意思,然后在心里形成一个精准的"搜索意图",再拿着这个意图去翻箱倒柜。
ReToken就是这样一个被专门训练出来的"搜索意图令牌"。它是一个可以学习的向量,在训练过程中被明确地训练成"一个好的检索查询"。训练时,这个令牌被放在问题的末尾,和所有图片信息、问题文字一起输入到AI的处理流程里。经过AI的整个内部计算流程之后,这个令牌在最后一层会输出一个向量,这个向量再经过一个简单的线性变换,就变成了最终的检索查询。
检索的方式是计算这个查询向量和每张图片(或每一帧视频)的平均值向量之间的**余弦相似度**(可以理解为两个向量"方向有多接近",越接近说明越相关)。相似度最高的若干帧,就被选出来作为回答问题的依据。
训练这个令牌的损失函数(可以理解为训练时的评分标准)也有特别的设计。由于在一堆图片中,相关图片往往只有一两张,而无关图片有几十上百张,如果直接计算平均损失,模型会倾向于忽视少数相关图片。为此,研究团队采用了**类平衡二值交叉熵损失**:把相关图片的损失单独取平均,把无关图片的损失也单独取平均,两部分损失加在一起,使得相关和无关两类得到同等的重视。
值得强调的是,整个训练过程中,背后那个大型视觉语言模型的参数完全不动,只有这一个令牌向量和一个线性变换矩阵在更新。这两样东西加在一起,参数量极少,训练效率极高——在单张H100显卡上训练三轮,只需要几个小时。
四、推理时的两步走:先找,再答
ReToken在回答问题时采用"两趟"策略,这个设计值得单独解释一下,因为它体现了一种聪明的工程权衡。
**第一趟是"侦察"**:把问题和ReToken令牌一起输入,让AI跑一遍完整的内部计算流程。在最后一层,ReToken输出的向量会和每帧图片的平均值向量比较相似度,选出前K帧最相关的画面。这一趟的目的只是找出"哪些画面是有用的",并不生成答案。
**第二趟是"回答"**:只把第一趟选出的那K帧画面加载进来,连同问题一起,让AI重新做一遍处理,这次才生成最终的回答。因为只加载了少量相关帧,这一趟的计算量大幅减少。
对于非常长的视频,系统还有更精细的处理:在第一趟的早期网络层里,由于显存限制无法同时看到所有帧,系统会在每层用当时已有的ReToken状态做一次粗粒度的筛选,只保留256帧继续往下传。到了最后一层,再做最终的精确排序。这就好像一个经验丰富的图书管理员先快速扫过所有书架,初步筛掉大部分不相关的区域,然后再对剩余的候选书架做仔细检查。
视频的编码(把视频转换成AI内部表示的过程)只需要做一次,结果会被缓存起来。之后无论问多少个问题,都只需要做两趟轻量级的查询,而不需要重新处理整段视频。这对于需要对同一段视频提问多个问题的场景来说,效率提升非常显著。
五、实验结果:数字背后的真实含义
研究团队在四个不同的基准数据集上做了测试,覆盖了从"图片堆里找一张"到"一小时长视频里找关键片段"等各种难度。
在**Visual Haystacks**(视觉干草堆)基准上,核心任务是:给定一堆图片(从2张到100张不等),其中只有一张和问题相关,看模型能否找到并正确回答。这个测试非常残酷,图片越多,随机猜对的概率越低。实验结果显示,随着图片数量从2增加到50,Qwen3VL-8B的原始准确率从82.0%跌到58.6%,而加入ReToken之后,50张时的准确率达到72.0%,提升了13.4个百分点,相当于超过20%的相对提升。InternVL3.5-8B在50张图片场景下同样提升了12.4个百分点。
在检索准确率(Recall@1,即最相关的一张是否被成功选出)上,对比更为直观。当图片堆有50张时,简单注意力方法只有1.8%的准确率(和随机猜几乎一样),基于CoT(让AI先想出搜索词再检索)的方法达到3.1%,而ReToken达到64.7%——这是一个量级上的提升。
在**QAEgo4DTest-MC**(长视频问答)基准上,每段视频平均有240帧,ReToken在只取1帧的极端条件下比均匀采样高出6.8个百分点,而对比方法ReKV在这种条件下甚至略差于均匀采样。随着帧数增加到16帧和32帧,ReToken仍然保持领先。
最让研究团队感到惊喜的是**LVBench**(极长视频理解)的结果。这个数据集里的视频平均长达68分钟,最长可达两小时。ReToken在这个任务上取得了8.0个百分点的提升。要注意的是,ReToken完全没有用视频数据训练,全靠多图片问答数据,却能在极长视频上实现零样本迁移——这说明它学到的是一种通用的"从大量视觉内容中检索相关信息"的能力,而不是对特定数据集的记忆。
在**Video-MME**(多时长视频)基准上,结果也印证了一个直觉上合理的规律:视频越短,ReToken的提升越小;视频越长,提升越显著。短视频(2分钟以内)完全没有提升(因为内容都在检索预算之内,不需要筛选),中等长度视频提升2.6个百分点,长视频提升3.4个百分点。
六、深入细节:那些让这个方法更有趣的发现
研究团队在实验过程中还揭示了几个颇有意思的现象,值得单独提及。
**关于KV缓存的"污染"问题**:在视频或多图场景下,视觉令牌在AI内部处理时会相互影响——一张图片的令牌在经过注意力层时,会"看到"前面那些图片的内容并受到影响。这意味着,即便你最终只用了正确图片的缓存,这个缓存里也已经混入了前面那些无关图片的信息干扰。实验量化了这个"污染程度":当图片堆只有2张时,这种干扰造成的准确率损失是1.3个百分点;当图片堆有50张时,损失扩大到7.1个百分点。研究团队发现,如果在训练ReToken时额外允许AI的前几层也参与微调(而不是完全冻结),这种污染会减轻,损失分别降低到1.0和5.5个百分点。
**关于单令牌是否足够**:研究团队也测试了同时训练3个ReToken的变体,结果发现3个令牌和1个令牌的性能几乎相当。这个结果看起来反直觉,但有一个合理的解释:在现有训练方式下,三个令牌都被同样的目标驱动,没有任何机制促使它们专注于不同的子任务,所以它们最终会收敛到类似的解。
**关于令牌是否需要"看图"**:研究团队还测试了一个极端变体:让ReToken完全看不到图片内容,只能看到问题文字。这样的ReToken只能根据问题来形成检索向量,而不能根据图片内容调整自己的判断。结果显示,这种"只看问题"的版本确实比随机强很多(63.1% vs 58.6% at C=50),但明显不如能同时看图的完整版本(72.0%)。这说明视觉内容本身也提供了有用的上下文,帮助ReToken更精准地定位目标。
**关于不同问题类型的表现差异**:通过LVBench对不同问题类型的分析,研究团队发现ReToken最擅长的是"关键信息检索"(+15.4个百分点)和"实体识别"(+10.5个百分点),这些任务的特点是答案集中在少数几帧里,只要找到正确的帧,答案就显而易见。相比之下,对于"事件理解"和"时序定位"类问题,提升幅度较小,因为这些问题的证据分散在多个片段中。最有趣的是"摘要"类问题:ReToken在这类问题上反而表现下降了5.2个百分点。道理很清晰——摘要需要综合全片信息,这时候精确检索少量帧的策略适得其反,均匀覆盖整个视频才是更好的选择。
七、与前辈们的对比:ReToken到底新在哪里
ReToken并不是第一个在AI里引入"可学习令牌"的方案,在它之前有不少先辈。比如BLIP-2的Q-Former和Flamingo的Perceiver Resampler,都使用了一组可学习的查询令牌来压缩视觉信息;Video-XL里有一个"视觉摘要令牌"用来压缩一段视频片段。
ReToken和这些方案有三个核心区别。其一,前辈们的令牌是静态的——它们在处理任何问题时都一样,不会根据具体问题动态调整;而ReToken是动态的,它在处理完整的问题和图片之后,在最后一层才形成最终的检索向量,自然地融入了当前问题的语义。其二,前辈们的训练目标是"视觉-语言对齐"或"生成正确答案",而ReToken明确地用检索准确率作为训练目标,直接对"找到正确图片"这件事负责。其三,前辈们通常需要32到64个令牌,而ReToken只需要1个。
在计算效率层面,ReToken的开销也非常轻微。按照论文中报告的数据,在处理一段约240帧的视频时,每个问题的检索阶段只需约0.52秒,回答阶段约0.17秒,而视频编码(只做一次)约需14.7秒。整体额外开销不到0.4秒每问题,但带来的准确率提升相当可观。
归根结底,这项研究的价值在于它找到了一个极其轻巧却颇为有效的解法来应对"AI看长内容时容易迷失"这个实际问题。研究团队没有去大幅改造现有模型,而是在模型外部加了一个专门负责"找东西"的小令牌,让它在值空间里做检索,效果远超传统的注意力检索方法。
这项方案最打动人的特质,大概是它的"轻量级跨域迁移能力":仅用静态图片的问答数据训练,就能在长达两小时的视频上实现有效检索。这说明"从大量视觉内容中准确定位相关信息"这件事,背后有某种与具体数据类型无关的通用规律,而ReToken学到了这种规律。
当然,它也有明显的局限:对于答案需要综合整个视频信息的摘要类问题,精准检索的策略会帮倒忙;训练数据仅限于多图问答,缺乏对时序结构的理解;两趟推理也增加了少量延迟。研究团队在论文中坦诚地指出了这些不足,并提出了未来可能的改进方向,比如针对连续帧组合的检索、对时序偏移问题的感知、以及在令牌级别而非帧级别进行更细粒度的检索。
如果你对AI如何处理长视频这个话题有进一步兴趣,可以通过arXiv编号2607.28627找到这篇论文的完整版本,里面包含更多实验细节和消融分析。
Q&A
Q1:ReToken是怎么训练的,需要大量数据吗?
A:ReToken的训练非常轻量。研究团队只用了约7万条多图片问答样本,而且训练时整个大型视觉语言模型的参数完全不动,只有ReToken这一个向量和一个线性矩阵在更新。在单张H100显卡上大约训练几小时就能完成,门槛相当低。
Q2:ReToken在长视频上没用视频数据训练,为什么还能有效果?
A:ReToken学到的本质上是一种通用的"从大量视觉内容中检索相关信息"的能力——它在值向量空间里判断哪些画面和当前问题最相关,这个机制与内容是图片还是视频帧无关。实验证明,仅凭多图问答训练,ReToken就能在平均68分钟的长视频上实现8个百分点的提升,说明这种迁移是真实有效的。
Q3:ReToken为什么在摘要类问题上反而表现变差了?
A:因为摘要类问题需要综合整个视频的全部内容,答案不集中在某几帧里。ReToken的检索策略是精准定位少量最相关帧,当答案需要全局信息时,这种精准筛选会丢失大量有用内容,反而不如均匀采样整段视频覆盖更全面。这是一个策略适配性的问题,不是模型本身的缺陷。