Skip to content

功能建议:支持视频理解(Video Understanding) #8

Description

@yanickxia

功能建议:支持视频理解(Video Understanding)

需求背景

目前 image_understand 工具只支持单张图片的视觉理解。但在实际使用中经常遇到需要分析视频的场景,例如:

  • 视频报错/异常排查:分析 bug 复现过程的录屏,定位错误发生的关键画面
  • UI 流程审查:对 App / 网页操作录屏进行逐步理解,检查交互流程是否符合预期
  • 教学/演示视频:提取视频中的关键信息、画面内容
  • 长视频摘要:对较长的视频做内容摘要和关键帧提取

建议方案

希望新增 video_understand 工具(或扩展 image_understand 支持视频输入),大致思路:

  1. 输入支持:本地视频文件路径、远程视频 URL(mp4 / webm 等),或直接传入 Base64 / Data URI
  2. 抽帧预处理:复用现有统一预处理链路,使用 ffmpeg 按固定间隔抽取关键帧(如每 2~5 秒一帧,或按场景切分提取关键帧),并控制帧数上限
  3. 多帧分析:将抽取的帧序列交给现有接入的视觉大模型(GLM-4.6V、Qwen3-VL-Flash、Doubao-Seed-1.6、Hunyuan-Vision 等)逐一或合并分析,汇总输出
  4. 可选:原生视频理解模型:部分视觉大模型已支持直接输入视频,可考虑作为可选的 provider

其他考虑

  • 帧数 / 分辨率等限制参数可配置,避免超出模型上下文与 token 预算
  • 尽量保持现有「单工具设计」的兼容性:最好能自动识别输入是图片还是视频,统一入口

感谢维护!如果这个方向可行,我可以协助提供实现细节或参与测试。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions