摘要
提示工程(prompt engineering)已成为提升语言模型性能的关键手段。当前的一个共识是:只要模型的输入空间足够丰富,就存在通过优化输入来获得更好下游性能的机会。 那么,这一原理是否仅适用于语言模型,还是同样可以推广到其他模态,比如视觉领域? 在一篇最新论文中,Google DeepMind 提出了“视觉提示工程”(visual prompt engineering,VIPE),将提示工程成功扩展到了视觉领域。 论文链接:https://arxiv.org/abs/2607.25537 实验结果显示,视觉提示工程方法能在多个任务上提升视频推理性能,且对视频模型来说,该方法有时比经典的文本提示工程或 test-time scaling 更有效。 正如文本提示工程能系统性地提升语言模型性能一样,视觉提示工程也可以作为一种简单、计算高效的方法,用来激发视频模型更好的视觉推理表现。 研究团队表示,视觉提示工程指向了一种新的范式,即“视觉提示本身也可以像文本提示一样被优化”。随着前沿视频模型接收更丰富的多模态上下文,视觉提示工程或许会从单张图像编辑,扩展到多张参考图像甚至视频。 视觉提示工程:在新的视觉场景中处理同一问题 视觉提示工程是针对视频模型视觉输入的提示工程方法,在不改变任务逻辑的前提下,将原始图像转换为模型更容易理解和推理的视觉形式,让模型能在新的视觉场景中处理同一问题。例如,抽象的球和斜坡示意图可以改为写实的台球和木板场景,关键空间关系需保持一致。 图|视觉提示工程从一个视觉提示开始,例如一张球和斜坡的草图图像,以及“球沿着……滚下,最后落入其中一个桶里”这样的文本提示。 具体流程如下: 1.构想器:负责提出图像该怎么改。它会根据任务样本和约束,生成一段自然语言编辑指令。指令里会明确哪些任务相关元素必须保留,比如物体数量、位置、朝向和相对关系 2.编辑器:根据编辑指令修改原图,生成一个或多个候选图。这个步骤可以由图像编辑模型完成,也可以由人工编辑完成。 3.筛选器:可选步骤。当编辑器生成多个候选图时,筛选器会从中选出更合适的版本。筛选器会优先选择图像质量更好、同时保留了原图任务关键信息的候选版本。 比文本指令更有效…
摘要可能不完整,可查看原文