功能建议:支持视频理解(Video Understanding)
需求背景
目前 image_understand 工具只支持单张图片的视觉理解。但在实际使用中经常遇到需要分析视频的场景,例如:
- 视频报错/异常排查:分析 bug 复现过程的录屏,定位错误发生的关键画面
- UI 流程审查:对 App / 网页操作录屏进行逐步理解,检查交互流程是否符合预期
- 教学/演示视频:提取视频中的关键信息、画面内容
- 长视频摘要:对较长的视频做内容摘要和关键帧提取
建议方案
希望新增 video_understand 工具(或扩展 image_understand 支持视频输入),大致思路:
- 输入支持:本地视频文件路径、远程视频 URL(mp4 / webm 等),或直接传入 Base64 / Data URI
- 抽帧预处理:复用现有统一预处理链路,使用 ffmpeg 按固定间隔抽取关键帧(如每 2~5 秒一帧,或按场景切分提取关键帧),并控制帧数上限
- 多帧分析:将抽取的帧序列交给现有接入的视觉大模型(GLM-4.6V、Qwen3-VL-Flash、Doubao-Seed-1.6、Hunyuan-Vision 等)逐一或合并分析,汇总输出
- 可选:原生视频理解模型:部分视觉大模型已支持直接输入视频,可考虑作为可选的 provider
其他考虑
- 帧数 / 分辨率等限制参数可配置,避免超出模型上下文与 token 预算
- 尽量保持现有「单工具设计」的兼容性:最好能自动识别输入是图片还是视频,统一入口
感谢维护!如果这个方向可行,我可以协助提供实现细节或参与测试。
功能建议:支持视频理解(Video Understanding)
需求背景
目前
image_understand工具只支持单张图片的视觉理解。但在实际使用中经常遇到需要分析视频的场景,例如:建议方案
希望新增
video_understand工具(或扩展image_understand支持视频输入),大致思路:其他考虑
感谢维护!如果这个方向可行,我可以协助提供实现细节或参与测试。