Gemini 开始主动“挑片段看”:代理式视频理解如何改变楼宇巡检

Google 9 月 1 日发布 Gemini 代理式视频理解。与按固定帧率把整段视频均匀送入模型不同,新方法会根据问题主动搜索、加速扫描并重新检查关键片段,同时结合画面、音频和字幕。Google 官方测试显示,在部分基准中最多减少 88% token、降低 66% 成本,并把准确率提高最多 7%。
关键变化是模型决定“哪里值得细看”
建筑视频通常很长,但真正相关的事件可能只有几秒:设备冒出短暂火花、人员在限制区停留、消防通道被物品遮挡,或电梯门出现一次异常抖动。固定采样可能错过瞬间,高帧率全量分析又会产生巨量成本。代理式分析会先粗查,再对可疑时间窗提高检查密度。

最适合的不是实时替代,而是长视频复核
现阶段它更适合事故回溯、施工记录检索、巡检视频摘要和异常片段定位,而不是替代消防联动、门禁联锁或实时安全系统。安全控制仍应由确定性规则和经过认证的设备完成,AI 用于缩小检索范围、准备证据和辅助人工判断。
落地时必须控制隐私和误报
- 限定摄像头范围与分析目的,不把生活区域视频无限期保存。
- 优先在本地完成脱敏、事件切片和人员身份遮蔽。
- 重要结论保留原始片段、时间戳和模型说明供人工复核。
- 对不同光线、遮挡、快速运动和不同场所进行独立测试。
建筑运维会得到一个更聪明的搜索入口
未来工程人员不必手动拖动数小时录像,而可以提出“找出昨天所有水泵异响前后的画面”或“定位卸货区被占用超过十分钟的时段”。模型负责找到候选片段,人负责确认事实和采取行动。价值不在于监控更多,而在于用更少数据更快找到真正需要处理的证据。
