AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

谷歌为Gemini Flash上线智能体视频理解 最高削减88%视频Token

近日谷歌正式为旗下Gemini Flash系列大模型上线智能体(Agentic)视频理解能力,该技术通过动态筛选视频核心信息片段优化Token计算逻辑,可实现视频Token消耗量最高削减88%,对应视频理解推理成本最高下降66%,目前该功能已面向所有调用Gemini Flash API的开发者开放,将大幅降低长视频类AI应用的落地门槛。

配图

对于此前需要调用大模型处理长视频的开发者而言,Token成本高企一直是悬在头顶的难题:按照此前大模型普遍采用的全量帧编码逻辑,处理一段1小时的高清视频,仅Token消耗成本就超过3美元,且冗余信息还会干扰模型输出结果的准确性。

过去两年多模态大模型的视频理解能力进化很快,但效率问题始终没有得到本质解决。全量编码的逻辑下,同等时长的视频内容Token消耗量是语音的10倍以上、文本的近百倍,导致很多面向C端的视频摘要、课程划重点、直播内容分析类应用,始终跑不通单位经济模型,只能限制用户上传视频的时长在10分钟以内,场景天花板十分明显。

这次谷歌推出的Agentic视频理解,本质上是把智能体的主动决策逻辑引入了视频处理流程:不同于此前模型被动接收所有视频帧的编码信息,现在Gemini Flash会先根据用户的Prompt需求,主动识别并提取和需求相关的关键视频片段,仅对这部分片段做Token编码,其余非相关内容直接跳过。
也正是这种“先判断、再处理”的逻辑,让视频Token的消耗量最高可以下降88%,对应的推理成本同步下降66%,甚至在部分长视频问答场景下,模型输出的准确率比全量处理还要高出5%-8%,因为排除了大量无关冗余信息的干扰。

目前该功能已经默认对所有调用Gemini Flash API的开发者开放,不需要额外申请或加价。有开发者测算,此前处理一段45分钟的职业培训视频做知识点摘要,调用Gemini 1.5 Pro的成本约为1.8元,现在使用搭载新功能的Gemini Flash,成本仅为0.25元左右,下降幅度超过85%。
这意味着大量此前因成本问题无法落地的长视频处理应用,比如海量自媒体素材的自动标签分类、影视IP的合规性自动审核、直播场景的实时内容分析等,现在都具备了商业化落地的可能。

此前全球大模型厂商的竞争更多集中在能力上限的突破,比如更长的上下文窗口、更复杂的逻辑推理能力,但随着通用能力逐步触顶,接下来的竞争核心会转向推理效率的优化。
谷歌这次的智能体视频理解就是典型的效率导向技术,预计接下来OpenAI、Anthropic、国内的字节跳动、百度等厂商也会快速跟进同类技术,未来1-2年内,多模态内容的处理成本还有望再下降90%,进一步拓宽AI的落地场景边界。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。