forked from lioensky/VCPToolBox
-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathmultimodal-config.json.example
More file actions
20 lines (20 loc) · 2.4 KB
/
Copy pathmultimodal-config.json.example
File metadata and controls
20 lines (20 loc) · 2.4 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
{
"MultiModalModel": "gemini-3.1-flash-lite",
"MultiModalPrompt": "你是Cognito-Core,高精度多模态分析引擎,你的唯一行为是将接收到的多媒体数据(图像、音频、视频)直接转译为结构化文本叙事——严禁输出任何自我介绍、角色声明、任务复述或开场白,你的输出字符必须是分析内容本身,任何前置寒暄均视为任务失败。你的全局准则:视觉与听觉必须整体分析而非独立处理,输出必须体现两者的时序同步与语义互动;意图优先于音标,必要时启动智能纠错还原说话者真实意图。对于图像,执行详尽的视觉元素分析与高精度OCR,一字不差转录所有可见文本,详细描述所有文本位置。对于音频,执行环境音分析与带智能纠错的语音转录。对于视频或视听媒体,采用强制性时序整合结构:将内容分解为连续场景,每个场景必须包含明确时间戳 [Time: HH:MM:SS]、详尽的视觉描述(场景、人物、镜头运动、特效、屏幕文本)、与该时间段精确对应的语音/歌词原文(保留原语言并智能纠错)、以及显著的音景变化(背景音乐与关键音效),四要素绑定于同一时间戳下不可拆分,从根本上杜绝只输出歌词而忽略画面的问题。",
"MediaInsertPrompt": "服务器已处理多模态数据,VCP系统已自动提取多模态数据信息,信息元如下——",
"MultiModalModelOutputMaxTokens": 50000,
"MultiModalModelContent": 250000,
"MultiModalModelThinkingBudget": 23000,
"MultiModalModelAsynchronousLimit": 10,
"MultiModalForceTranslateModels": ["deepseek", "glm"],
"__description": {
"MultiModalModel": "多模态识别模型 ID(如 gemini-3.1-flash-lite)",
"MultiModalPrompt": "多模态识别系统提示词,发送给多模态模型用于结构化转译",
"MediaInsertPrompt": "识别完成后插入到 user 文本块的引导语",
"MultiModalModelOutputMaxTokens": "多模态识别 max_tokens,默认 50000",
"MultiModalModelContent": "多模态最大上下文 token,仅作展示参考",
"MultiModalModelThinkingBudget": "Gemini thinking_budget,>0 启用 thinking",
"MultiModalModelAsynchronousLimit": "多模态异步并发上限,最小 1",
"MultiModalForceTranslateModels": "纯文本模型 Tag 数组(小写匹配),命中即强制把多模态翻译为文本"
}
}