Skip to content

Latest commit

 

History

24 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

AIBench 后端 · AI 评测资讯 Pipeline

本仓库是 AIBench 的自动化资讯后端,面向 AI / LLM 评测领域,持续聚合 benchmark、数据集、评估框架、模型与工具发布及相关方法论文。

我们致力于打造一个客观、自动化的 AI 评测资讯工具:从多源信息抽取、内容理解、分类评分到日报、微信公众号和小红书等多渠道输出,尽可能降低人工筛选偏差,让高质量评测信息更快抵达读者。

🌐 访问 AIBench: https://aibench.cn

PIPELINE(sources.yaml → EXTRACT → FILTER → OUTPUT)

核心原则:FILTER 的分类、评分与摘要由 Claude / Codex 直接阅读内容完成,以统一的 Tier 与五维质量标准筛选资讯。


快速开始

下载或克隆仓库后,用 Codex 或 Claude Code 打开 Insight-Agent 项目目录。首次运行前可按需编辑 sources.yaml,选择要启用的数据源;Twitter、微信公众号和小红书等账号配置均为可选项,不影响基础日报生成。

git clone https://github.com/shenye7436/Insight-Agent.git
cd Insight-Agent

不需要逐个执行 Extract、Filter 和 Output 脚本。最稳妥的首次使用方式是直接告诉 Agent:

请读取 pipeline/SKILL.md,运行完整 Pipeline,生成今天的 AI 评测资讯日报。只生成并保存结果,不发布到微信或小红书。

完成后,结果会保存在 data/runs/<timestamp>/output/,其中 report.md 是 Markdown 日报,wechat.md / wechat.html 是微信公众号稿件,P0/P1/P2/ 包含各 Tier 的内容与小红书素材。

安装为 Skills(可选)

extract/filter/output/pipeline/ 四个目录复制或链接到 Agent 的 Skills 目录后,可以更简洁地触发:

Agent Skills 目录 示例指令
Codex 项目级 .agents/skills/ 或个人级 $HOME/.agents/skills/ $pipeline 生成今天的 AI 评测资讯日报,只生成不发布
Claude Code 项目级 .claude/skills/ 或个人级 ~/.claude/skills/ /pipeline 生成今天的 AI 评测资讯日报,只生成不发布

安装后也可以直接使用自然语言,例如“生成今天的 AI 评测资讯”或“基于最近 7 天日报生成周报”。Agent 会根据任务自动选择对应 Skill;涉及微信公众号或小红书发布时,建议明确说明是否发布以及可见范围。

参考:Codex Skills 文档 · Claude Code Skills 文档


目录

路径 作用
extract/ 多源数据抽取
filter/ 合并去重 + 判 tier / 评分 / 中文摘要
output/ 报告、配图、小红书、微信、周报
pipeline/ 端到端编排
sources.yaml 数据源开关与参数
data/runs/<timestamp>/ 每次日报运行产物
data/weekly/<week-id>/ 周报产物

一次日报 run 目录:

data/runs/<timestamp>/
├── raw/            # 各源原始 JSON
├── merged.json     # 合并去重
├── filtered.json   # 筛选评分(含摘要、配图路径)
├── images/         # 配图
├── fulltext/       # 小红书用 arXiv 全文
├── logs/
└── output/
    ├── report.md              # Markdown 日报(可选 / 邮件)
    ├── wechat.md / wechat.html # 微信稿(发公众号时用)
    ├── cover.jpg              # 微信封面
    └── P0/ P1/ P2/            # 单篇 md + 小红书长文(主产物)

1. Extract — 数据抽取

sources.yaml 中启用的源抓取内容,写入 $RUN_DIR/raw/<source>.json

数据源 内容范围 配置说明
arXiv cs.CL / cs.AI / cs.LG 等方向的评测相关论文 考虑索引延迟,通常使用更长的采集时间窗
GitHub LLM benchmark、evaluation 工具与相关仓库 sources.yaml 中配置开关和数量
Reddit 机器学习与 AI 评测相关社区内容 可选数据源
Hugging Face Daily Papers 等论文资讯 sources.yaml 中配置
smol.ai AI 行业与研究资讯 sources.yaml 中配置
Twitter / X 实验室、研究机构及评测相关账号动态 可选;首次启用需完成账号配置
Company Research OpenAI、Anthropic、Google DeepMind、Qwen 等官方研究动态 sources.yaml 中配置

Extract 是工具链的数据入口。运行 Pipeline 时,系统会根据 sources.yaml 中的开关与参数自动调度各数据源,无需逐个执行抓取脚本。

要点:

  • 所有来源统一输出为 title / url / date / summary / metadata 等标准字段,供后续合并、去重和评分
  • arXiv 的机构过滤在 FILTER 阶段仅对关键词快筛后的候选执行,避免对全量论文进行无效处理
  • Twitter 为可选数据源,首次启用前需完成账号配置;代理及故障排查方式见专门文档

extract/SKILL.md · extract/PROXY_CONFIG.md


2. Filter — 筛选与评分

raw/*.json → merge_raw.py → merged.json → 模型逐条评分 → filtered.json

2.1 合并去重

  • 扁平化元数据(authors、likes、arxiv_id 等提到顶层)
  • URL + 标题去重;删 retweets
  • 标题 Jaccard 相似度话题聚类(同发布只留一个 winner)
  • Twitter 只保留 ≥100 likes
  • 应用 --days 时间窗

2.2 判 Tier + 五维评分(单遍,无脚本打分)

逐条读 title + 内容 → 判主要贡献 → 定 tier → 用该 tier rubric 打分。

Tier 主要贡献
P0 已发布、可用的产品 / 模型 / 工具 模型上线公告
P1 基准 / 数据集 / 评估框架本身是贡献 新 benchmark
P2 方法论文,用基准做评估 We propose X, eval on Y
drop 与 AI 评测无关

五维(1–5):Authority · Relevance · Impact · Innovation · Depth

quality = tier_weights × scores / 5,门槛:P0 ≥ 0.75P1/P2 ≥ 0.80

arXiv:关键词快筛→ 机构过滤(删 chinese_other)→ 逐条细评。

2.3 摘要与截断

  • 为选中项写 summary_zh_long(3–5 句,非模板)
  • 过门槛后按 Tier × quality 排序,P0 / P1 / P2 每个 Tier 取 Top 10,全天最多 30 条
  • 写出 filtered.json

filter/SKILL.md


3. Output — 多渠道输出

顺序固定:**建报告 → 抓图 → 再重建报告。

3.1 / 3.3 报告

产物 用途
P0/ P1/ P2/ 主产物:每条 NN_slug.md + 小红书长文
report.md Markdown 日报(可选 / 邮件)
wechat.md / wechat.html 微信公众号(发的时候才用)
cover.jpg 微信封面

3.2 配图(必须)

优先级:Twitter 媒体 → 官网截图 → arXiv HTML / PDF 首页 → og:image → 默认封面。

图片命名按 filtered.json 全局序号 {NN}-{slug}.ext;tier 里 md 的 01_tier 内序号,不要混用。

md 位置 图片引用
output/report.md ../images/...
output/P{n}/*.md ../../images/...
导出目录(images 与 P0/P1/P2 平级) ../images/...

3.4 小红书

P1 / P2 各取 quality Top 2 作为高质量候选,并以单篇论文为单位制作内容:每次选取一篇论文,抓取并阅读全文后进行独立分析,手写有具体方法、数据与结论的深度解读。

完成文案后,将单篇解读渲染为小红书卡片,包括一张封面和多张正文逻辑卡;每篇论文独立成帖,配套生成标题、配文和原文链接。p{n}_benchmark_summary.md 作为 Tier Top 2 截图汇总帖备用。

周报 / 发布(可选)

周报直接复用指定周期内各日报的 filtered.json,按 URL 去重后,根据 quality 分数在每个 Tier 中选取 Top 10。周报沿用日报评分与配图,不重复评分或抓图,并生成适合微信公众号发布的 Markdown、HTML 与封面。

日报和周报均支持按需发布到微信公众号;发布能力属于可选环节,不影响资讯抽取、筛选与报告生成。

output/SKILL.md


4. Pipeline — 编排

把 Extract → Filter → Output 串成一次完整运行;也可只跑某一阶段、指定源、或复用已有 RUN_DIR

依赖

pip install requests beautifulsoup4 lxml pyyaml httpx snscrape 'twscrape>=0.18.0' pypdf pymupdf
pip install playwright && playwright install chromium   # 官网截图等

另需:curl;微信发布还需 node / npmwenyan_publish.sh 会安装 @wenyan-md/cli)。

配置密钥

仓库不包含任何账号凭证。clone 后按需在本地创建下列文件:

用途 本地文件 怎么配
Twitter 抓取 extract/accounts.db python extract/scripts/twitter_extract.py --setup
微信公众号发布 output/weixin_env cp output/weixin_env.example output/weixin_env,填入 WECHAT_APP_ID / WECHAT_APP_SECRET
小红书发布 output/xiaohongshu_env cp output/xiaohongshu_env.example output/xiaohongshu_env,填入 XHS_COOKIE
代理(可选) extract/PROXY_CONFIG.md 按本机网络环境配置;无需代理可留空
GitHub API(可选) 环境变量 GITHUB_TOKEN 提高 GitHub 搜索限速

只跑抽取 + 筛选 + 出报告时,可不配微信 / 小红书;Twitter 源需要 accounts.db,关掉该源则可跳过。

About

No description, website, or topics provided.

Resources

Stars

4 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages