问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日谷歌正式为旗下Gemini Flash系列大模型上线智能体(Agentic)视频理解能力,该技术通过动态筛选视频核心信息片段优化Token计算逻辑,可实现视频Token消耗量最高削减88%,对应视频理解推理成本最高下降66%,目前该功能已面向所有调用Gemini Flash API的开发者开放,将大幅降低长视频类AI应用的落地门槛。

对于此前需要调用大模型处理长视频的开发者而言,Token成本高企一直是悬在头顶的难题:按照此前大模型普遍采用的全量帧编码逻辑,处理一段1小时的高清视频,仅Token消耗成本就超过3美元,且冗余信息还会干扰模型输出结果的准确性。
过去两年多模态大模型的视频理解能力进化很快,但效率问题始终没有得到本质解决。全量编码的逻辑下,同等时长的视频内容Token消耗量是语音的10倍以上、文本的近百倍,导致很多面向C端的视频摘要、课程划重点、直播内容分析类应用,始终跑不通单位经济模型,只能限制用户上传视频的时长在10分钟以内,场景天花板十分明显。
这次谷歌推出的Agentic视频理解,本质上是把智能体的主动决策逻辑引入了视频处理流程:不同于此前模型被动接收所有视频帧的编码信息,现在Gemini Flash会先根据用户的Prompt需求,主动识别并提取和需求相关的关键视频片段,仅对这部分片段做Token编码,其余非相关内容直接跳过。
也正是这种“先判断、再处理”的逻辑,让视频Token的消耗量最高可以下降88%,对应的推理成本同步下降66%,甚至在部分长视频问答场景下,模型输出的准确率比全量处理还要高出5%-8%,因为排除了大量无关冗余信息的干扰。
目前该功能已经默认对所有调用Gemini Flash API的开发者开放,不需要额外申请或加价。有开发者测算,此前处理一段45分钟的职业培训视频做知识点摘要,调用Gemini 1.5 Pro的成本约为1.8元,现在使用搭载新功能的Gemini Flash,成本仅为0.25元左右,下降幅度超过85%。
这意味着大量此前因成本问题无法落地的长视频处理应用,比如海量自媒体素材的自动标签分类、影视IP的合规性自动审核、直播场景的实时内容分析等,现在都具备了商业化落地的可能。
此前全球大模型厂商的竞争更多集中在能力上限的突破,比如更长的上下文窗口、更复杂的逻辑推理能力,但随着通用能力逐步触顶,接下来的竞争核心会转向推理效率的优化。
谷歌这次的智能体视频理解就是典型的效率导向技术,预计接下来OpenAI、Anthropic、国内的字节跳动、百度等厂商也会快速跟进同类技术,未来1-2年内,多模态内容的处理成本还有望再下降90%,进一步拓宽AI的落地场景边界。