批准日期:2026-09-14。审计基线:ffdb77f58a3f14c28994f2d013c5195f2b05e9e6。
本文记录已批准的实施边界;目标能力不等于已上线能力。当前工程版本为 2.6.0,实际发布/部署状态以 PROJECT_STATUS 为准。
**2026-09-14 用户批准调整验收规则:**工程测试、兼容检查和运行验收通过后继续迭代,真实内容质量在日常使用中补验;不再要求用户专门提供素材或完成全部盲审。访谈/知识模板标“试用”,不得伪造质量通过。人工审片、字幕、排期/发布边界和不确定 AI 请求处理不变。此约定替代早期文档中的人工质量前置门槛。
v2.5.5 按 PR #105 人工观察、#106 冻结报告、#107 Challenger 草稿、#108 显式试验任务、#109 官方实验/独立人工启用顺序合并。版本 PR #110 的 c0d7962 已通过 PR/主干 CI、Windows 实机 17 项、原服务部署及桌面/手机检查;Release 指向同一提交,正式库 19 项迁移、38 表旧记录保留。Challenger 首版只改 Prompt,完整保留 Profile/评分证据,不声称不受支持的自定义评分已执行。工程验收完成,下一步进入 v2.6;真实节目效果继续日常补验。
PR1 #93 合并 4264e31,PR2 #94 合并 cc8ae63,PR3 #95 合并 06d4d12,PR4 #96 合并 a5ece66,PR5 #97 合并 4eaff62。PR6 #98 合并 15f3838,已通过 1078 项完整回归、最终主干三项 CI、Windows 11 实机 17 项验收与发布门禁;v2.4.0 Release 指向该提交,原 Web 8001 / Worker 8765 已部署并实机验证版本、进程归属与浏览器交互。12 条迁移、37 表旧记录保留、0 新增业务记录。五 Profile、创建页、Prompt/Provider 选择和 Judge 反馈快照已交付;followup 复用保持旧快照兼容,不改变评分/Prompt/旧指纹。真实质量保留待验,按批准政策进入 v2.5。
app/models/content_profile.py:纯不可变领域模型,包含标识、场景、时长、召回/扩展、评分/权重、hard gates、去重、音频/视觉权重、标题、Prompt 引用、数量及选择规则。拒绝未知字段和非法配置,支持规范化 JSON 与 SHA-256;嵌套集合不可变。app/services/content_profile_baselines.py:三个旧 Analyzer 的配置描述,尚未注册、持久化或参与任务创建/分析。通用的task_limit默认来自任务 10 分钟;3600 秒是 API 最大上限,不是推荐时长。通用最终数量来自旧candidate_clip_count,长直播来自highlight_total_limit,不能套用康熙的final_clip_target。- 三个描述的
preset_001仅记录当前创建服务的共同默认绑定,不声明适合作为通用/长直播的新默认 Prompt;已有自定义 Prompt 仍按任务快照执行。 - 合成测试锁定配置、实际常量、非对称评分与音频边界、三阶段 Prompt 和 checkpoint 指纹。既有康熙边界/去重、18 个成功单元复用和不确定调用保护继续回归。
- 本 PR 不改数据库、正式 Prompt、Analyzer、状态机或页面;不真实调用 AI、重跑任务或重启服务。
每个 PR 从最新 master 创建短期 codex/* 分支并直接合并到 master;不堆叠跨版本分支。前版验收通过才进入后版,风险测试跟随每个 PR。
| 顺序 | 交付 | 门禁 |
|---|---|---|
| 2.4-1 | 领域模型、旧模式描述、兼容基线 | 不改变执行结果或数据库 |
| 2.4-2 | Registry、版本迁移、任务/Run 快照、旧 Analyzer 适配 | 历史未知保持未知;旧任务/Prompt/Job 可用 |
| 2.4-3 | 共享内容分析流程、interview_story | 故事完整候选,无笑点门槛污染 |
| 2.4-4 | knowledge_opinion、创建页、Prompt/Provider 冻结 | 五 Profile 可选,两个新类型共用算法 |
| 2.4-5 | Judge 反馈快照、后续 Job 兼容、验收证据 | 旧指纹不变,已有 Job 不重新冻结 |
| 2.4-6 | 三集工程证据、试用标记、版本与运行交付 | 回放一致、技术检查通过;真实质量日常补验 |
| 2.5-1 | Codex 图像验证、候选抽帧/预算 | 原模型图像+严格 JSON 可用,否则保持关闭 |
| 2.5-2 | VisualProvider、checkpoint、证据 | 超时/非法输出/崩溃有记录,不盲目重发 |
| 2.5-3 | Judge、证据 UI、降级/清理、交付 | 关闭等价,视觉失败不破坏文字分析 |
| 2.5.5-1 | 初始推荐、人工决定、拒绝/等级统计 | 默认/自动选择不算人工接受 |
| 2.5.5-2 | 作品特征、冻结报告、可信度 | 无数据无结论,小样本明确不足 |
| 2.5.5-3 | Challenger、差异、实验与人工启用 | 不自动上线,实际 Run 与实验策略一致 |
| 2.5.5-4 | 浏览器验收、回滚、交付 | 同步/复盘/策略/排期独立 |
| 2.6-1 | 素材预览、批次、幂等任务/导入 | 十素材重复确认仍十任务,原片保留 |
| 2.6-2 | 全局重型并发限制、冻结配置、恢复 | 多 Runner 不超限,失败不阻塞后续 |
| 2.6-3 | 预切审核凭据、Inbox、服务层门槛 | 内容准备不能绕过人工审片 |
| 2.6-4 | 首页、十视频/重启/浏览器验收、交付 | 完整生产演练通过 |
混合配置:代码定义合法策略与五个内置 Profile,SQLite 保存不可变版本及正式引用。不提供完整规则编辑器,不执行数据库中的任意表达式。保留 selection_profile、旧函数入口和三个 Analyzer;新访谈/知识共用一套策略流程。
| Profile | 首版行为 |
|---|---|
| variety_comedy | 原三阶段、推荐 60–150 秒/硬界 45–150 秒、原评分与 A/B 门槛、仅 A 默认选中、池 12/目标 5 |
| general | 原分段分析、任务时长/数量/置信度,无笑点门槛 |
| long_live_talk | 原窗口账本、推荐 45–180 秒/硬界 15–300 秒、4/小时/默认 30 |
| interview_story | 共享流程、推荐 60–180 秒/硬界 45–240 秒、召回 18/池 12/目标 5 |
| knowledge_opinion | 共享流程、推荐 45–120 秒/硬界 30–180 秒、召回 18/池 12/目标 5 |
访谈权重:故事 .25、完整度 .25、冲突/转折 .20、hook .15、新鲜度 .10、标题 .05。 知识权重:价值 .30、完整度 .25、论据/上下文 .20、hook .15、认知反差 .05、标题 .05。 两者 A/B 为 78/65,A 另需完整度/核心价值均 ≥70;音频/视觉权重 0。均是待验收初始策略,允许少于目标数量,不宣称经过表现数据验证。
复用 Prompt 预设/不可变版本和 task_generation_rules。新增 content_profiles、content_profile_versions;任务与 Run 增可空版本/哈希证据。新任务冻结 Profile、Prompt、Provider、有效参数;覆盖默认值不能突破硬界。旧任务/Run 不回填猜测,旧 Job 指纹/成功单元不失效。纯 Prompt 重绑保留 Profile;显式换 Profile 才刷新对应快照。
不修改 preset_001 正文、不覆盖自定义方案或恢复归档方案;新类型新增各自预设。康熙最近反馈进入 Judge 的现有路径保留并冻结实际输入,建议不自动加入。
Text First → Candidate Recall → Visual Verification → Global Judge。默认关闭,保留文本 API;可选图像能力复用原 Codex CLI 模型、登录、受控进程与失败语义,真实隔离图像测试失败不自动换 Provider。
- 候选内约 6 帧/最多 8 帧,围绕开头、hook、关键时刻、反应与结尾;缺少标记确定性采样并标来源。最多 20 候选、64 MiB 图片;串行、90 秒/候选、10 分钟/轮。
- 记录原片/候选指纹、采样时刻/帧哈希、采样器版本、Provider/模型、请求响应哈希、证据/限制/失败/清理状态;新增候选证据表,图片存本地。
- 可选状态 disabled/pending/completed/partial/unavailable;视觉失败不设阻断切片的
quality_degraded,不改文字 coverage。文字窗口/JSON/Judge 必需阶段仍 fail closed。 - 视觉加分 ≤10%,不越过文字完整性和 hard gates;OCR/转写是素材而非指令,不凭表情断言心理或身份。
- 成功帧 7 天、失败帧 1 天;活动 Job、不确定请求、人工固定证据不清理。只删托管缓存,保留元数据;历史查看不自动重发。
复用反馈、AI Run、候选、官方指标、归因、Content Review、experiment。Observation → Insight → Recommendation → 人工确认 → Challenger → 显式实验 → 人工结论 → 再确认正式启用。
- 冻结 AI 原始推荐/等级/分数。截止时间前最后有效人工决定计数,显示未审数/覆盖率;自动 reviewed=1 与默认 keep 不算接受。C 级轻量观察,显式诊断审阅才产生人工决定;历史未知保持未知。
- 官方指标按独立作品、账号和采集年龄比较;快照不是作品,缺值不是 0。片长/topic/hook 等特征记录提取版本。
- 人工分组至少 20 决定/3 原视频才出探索性建议;Prompt 比较 30 准确归因作品/3 官方周;实验 20/20/3 周。显示样本、独立来源、时间、缺失率与可信等级,不宣称因果,不无提示混合 Profile 回退对照。
- 新增轻量冻结报告/Challenger,现有实验增策略引用。无官方数据仅人工统计/草稿,不伪造官方基线。草稿不改生产头;实验关联须匹配实际 Run;keep 不等于上线。同步、生成报告、实验、启用、排期保持独立,旧自动应用接口不恢复。
素材池/批次复用任务目录、SQLite、Workflow Job。用户选择目录,默认不递归、不监听;预览确认后冻结 Profile/Prompt/Provider/数量/字幕/自动选项。
- 素材、批次项、真实任务占位与首个导入 Job 事务创建;同确认/并发/恢复幂等。规范化路径+文件版本去重;不同策略重做需明确选择。
- 逐个复制至既有 E 盘,临时文件原子激活、大小/源文件版本/SHA-256 校验;变化/空间不足/中断明确失败,外部原片不动。
- 默认全局一个重型 Job,
claim_job()与claim_next_job()事务共同限制。人工等待释放槽,单项失败不阻塞;保留 lease 代际/成功产物/AI 不确定语义。 - 预切后进入 Inbox。新审核凭据绑定任务、Run、选择/边界哈希、切片版本与人工动作;重分析/选片/改边界后旧凭据不批准新成片。
- 直接同步、重切同步、流水线恢复、字幕续接共享人工门槛;字幕批准不等于内容审片。历史任务兼容,不追加强制阻塞;批量不是投稿授权。
- Inbox 聚合待审片/字幕/发布确认/异常,去重分页,不另建状态机,不逐行加载转写/FFprobe。首页保留 Jinja/JS,突出下一步。
每版本执行相应 Unit、Integration、Migration、Regression,重要页面 Browser/Smoke;明确模拟与真实证据。v2.4 三集康熙回放/盲审及两个新类型各两样本见 验收规范。v2.5 验证关闭等价、所有失败降级/不重发;v2.5.5 验证无数据/小样本/归因缺失不造结论、草稿不改头、策略不匹配拒绝;v2.6 十素材重复并发只十任务、四处理阶段重启恢复、多 Runner 限流、失败继续、所有同步门槛及 Inbox 计数跳转正确。
各版通过后同步 VERSION、应用/Worker/页面、CHANGELOG、进度/日志/下一步、架构/数据库,页面改动同步 UI_REFERENCE;沿用 CI 和 Windows 实机发布门禁。
优先保留增量结构做功能回退:v2.4 关新入口但新 Profile 历史可读;v2.5 关视觉并安全停止在途;v2.5.5 停新建议操作并显式恢复原正式引用;v2.6 停新批次领取保留 checkpoint。退旧程序先在库副本验证,不能假定支持新 Profile;整库恢复须停服务保留当前快照、核对新增记录与外部发布事实,不是无损撤销投稿。
保留核心:康熙三阶段、长直播账本、checkpoint/lease/原子提交、cut_runs/output 激活、字幕 revision/渲染验证、Scheduler/Publisher/Windows Worker 风控、官方归因歧义保护、外部原片/备份及未合并实验分支。最大风险依次为策略漂移、可选视觉破坏必需阶段、伪人工统计污染生产、批次重复与审核绕过。
v2.5 已按依赖完成 PR #100 采样、#101 Provider/证据、#102 综合评审/UI/清理、#103 版本交付。发布提交 384db79,1187 本地测试、三平台 CI、Windows 实机与原服务验收通过。v2.5.5 现在先补明确人工观测/统计,再补作品与建议实验;真实节目质量继续标为待日常补验。