本仓库是 AIBench 的自动化资讯后端,面向 AI / LLM 评测领域,持续聚合 benchmark、数据集、评估框架、模型与工具发布及相关方法论文。
我们致力于打造一个客观、自动化的 AI 评测资讯工具:从多源信息抽取、内容理解、分类评分到日报、微信公众号和小红书等多渠道输出,尽可能降低人工筛选偏差,让高质量评测信息更快抵达读者。
🌐 访问 AIBench: https://aibench.cn
PIPELINE(sources.yaml → EXTRACT → FILTER → OUTPUT)
核心原则:FILTER 的分类、评分与摘要由 Claude / Codex 直接阅读内容完成,以统一的 Tier 与五维质量标准筛选资讯。
下载或克隆仓库后,用 Codex 或 Claude Code 打开 Insight-Agent 项目目录。首次运行前可按需编辑 sources.yaml,选择要启用的数据源;Twitter、微信公众号和小红书等账号配置均为可选项,不影响基础日报生成。
git clone https://github.com/shenye7436/Insight-Agent.git
cd Insight-Agent不需要逐个执行 Extract、Filter 和 Output 脚本。最稳妥的首次使用方式是直接告诉 Agent:
请读取
pipeline/SKILL.md,运行完整 Pipeline,生成今天的 AI 评测资讯日报。只生成并保存结果,不发布到微信或小红书。
完成后,结果会保存在 data/runs/<timestamp>/output/,其中 report.md 是 Markdown 日报,wechat.md / wechat.html 是微信公众号稿件,P0/、P1/、P2/ 包含各 Tier 的内容与小红书素材。
将 extract/、filter/、output/ 和 pipeline/ 四个目录复制或链接到 Agent 的 Skills 目录后,可以更简洁地触发:
| Agent | Skills 目录 | 示例指令 |
|---|---|---|
| Codex | 项目级 .agents/skills/ 或个人级 $HOME/.agents/skills/ |
$pipeline 生成今天的 AI 评测资讯日报,只生成不发布 |
| Claude Code | 项目级 .claude/skills/ 或个人级 ~/.claude/skills/ |
/pipeline 生成今天的 AI 评测资讯日报,只生成不发布 |
安装后也可以直接使用自然语言,例如“生成今天的 AI 评测资讯”或“基于最近 7 天日报生成周报”。Agent 会根据任务自动选择对应 Skill;涉及微信公众号或小红书发布时,建议明确说明是否发布以及可见范围。
参考:Codex Skills 文档 · Claude Code Skills 文档
| 路径 | 作用 |
|---|---|
extract/ |
多源数据抽取 |
filter/ |
合并去重 + 判 tier / 评分 / 中文摘要 |
output/ |
报告、配图、小红书、微信、周报 |
pipeline/ |
端到端编排 |
sources.yaml |
数据源开关与参数 |
data/runs/<timestamp>/ |
每次日报运行产物 |
data/weekly/<week-id>/ |
周报产物 |
一次日报 run 目录:
data/runs/<timestamp>/
├── raw/ # 各源原始 JSON
├── merged.json # 合并去重
├── filtered.json # 筛选评分(含摘要、配图路径)
├── images/ # 配图
├── fulltext/ # 小红书用 arXiv 全文
├── logs/
└── output/
├── report.md # Markdown 日报(可选 / 邮件)
├── wechat.md / wechat.html # 微信稿(发公众号时用)
├── cover.jpg # 微信封面
└── P0/ P1/ P2/ # 单篇 md + 小红书长文(主产物)
从 sources.yaml 中启用的源抓取内容,写入 $RUN_DIR/raw/<source>.json。
| 数据源 | 内容范围 | 配置说明 |
|---|---|---|
| arXiv | cs.CL / cs.AI / cs.LG 等方向的评测相关论文 | 考虑索引延迟,通常使用更长的采集时间窗 |
| GitHub | LLM benchmark、evaluation 工具与相关仓库 | 在 sources.yaml 中配置开关和数量 |
| 机器学习与 AI 评测相关社区内容 | 可选数据源 | |
| Hugging Face | Daily Papers 等论文资讯 | 在 sources.yaml 中配置 |
| smol.ai | AI 行业与研究资讯 | 在 sources.yaml 中配置 |
| Twitter / X | 实验室、研究机构及评测相关账号动态 | 可选;首次启用需完成账号配置 |
| Company Research | OpenAI、Anthropic、Google DeepMind、Qwen 等官方研究动态 | 在 sources.yaml 中配置 |
Extract 是工具链的数据入口。运行 Pipeline 时,系统会根据 sources.yaml 中的开关与参数自动调度各数据源,无需逐个执行抓取脚本。
要点:
- 所有来源统一输出为
title/url/date/summary/metadata等标准字段,供后续合并、去重和评分 - arXiv 的机构过滤在 FILTER 阶段仅对关键词快筛后的候选执行,避免对全量论文进行无效处理
- Twitter 为可选数据源,首次启用前需完成账号配置;代理及故障排查方式见专门文档
→ extract/SKILL.md · extract/PROXY_CONFIG.md
raw/*.json → merge_raw.py → merged.json → 模型逐条评分 → filtered.json
- 扁平化元数据(authors、likes、arxiv_id 等提到顶层)
- URL + 标题去重;删 retweets
- 标题 Jaccard 相似度话题聚类(同发布只留一个 winner)
- Twitter 只保留 ≥100 likes
- 应用
--days时间窗
逐条读 title + 内容 → 判主要贡献 → 定 tier → 用该 tier rubric 打分。
| Tier | 主要贡献 | 例 |
|---|---|---|
| P0 | 已发布、可用的产品 / 模型 / 工具 | 模型上线公告 |
| P1 | 基准 / 数据集 / 评估框架本身是贡献 | 新 benchmark |
| P2 | 方法论文,用基准做评估 | We propose X, eval on Y |
| drop | 与 AI 评测无关 | — |
五维(1–5):Authority · Relevance · Impact · Innovation · Depth
quality = tier_weights × scores / 5,门槛:P0 ≥ 0.75,P1/P2 ≥ 0.80。
arXiv:关键词快筛→ 机构过滤(删 chinese_other)→ 逐条细评。
- 为选中项写
summary_zh_long(3–5 句,非模板) - 过门槛后按 Tier ×
quality排序,P0 / P1 / P2 每个 Tier 取 Top 10,全天最多 30 条 - 写出
filtered.json
顺序固定:**建报告 → 抓图 → 再重建报告。
| 产物 | 用途 |
|---|---|
P0/ P1/ P2/ |
主产物:每条 NN_slug.md + 小红书长文 |
report.md |
Markdown 日报(可选 / 邮件) |
wechat.md / wechat.html |
微信公众号(发的时候才用) |
cover.jpg |
微信封面 |
优先级:Twitter 媒体 → 官网截图 → arXiv HTML / PDF 首页 → og:image → 默认封面。
图片命名按 filtered.json 全局序号 {NN}-{slug}.ext;tier 里 md 的 01_ 是 tier 内序号,不要混用。
| md 位置 | 图片引用 |
|---|---|
output/report.md |
../images/... |
output/P{n}/*.md |
../../images/... |
| 导出目录(images 与 P0/P1/P2 平级) | ../images/... |
P1 / P2 各取 quality Top 2 作为高质量候选,并以单篇论文为单位制作内容:每次选取一篇论文,抓取并阅读全文后进行独立分析,手写有具体方法、数据与结论的深度解读。
完成文案后,将单篇解读渲染为小红书卡片,包括一张封面和多张正文逻辑卡;每篇论文独立成帖,配套生成标题、配文和原文链接。p{n}_benchmark_summary.md 作为 Tier Top 2 截图汇总帖备用。
周报直接复用指定周期内各日报的 filtered.json,按 URL 去重后,根据 quality 分数在每个 Tier 中选取 Top 10。周报沿用日报评分与配图,不重复评分或抓图,并生成适合微信公众号发布的 Markdown、HTML 与封面。
日报和周报均支持按需发布到微信公众号;发布能力属于可选环节,不影响资讯抽取、筛选与报告生成。
把 Extract → Filter → Output 串成一次完整运行;也可只跑某一阶段、指定源、或复用已有 RUN_DIR。
pip install requests beautifulsoup4 lxml pyyaml httpx snscrape 'twscrape>=0.18.0' pypdf pymupdf
pip install playwright && playwright install chromium # 官网截图等另需:curl;微信发布还需 node / npm(wenyan_publish.sh 会安装 @wenyan-md/cli)。
仓库不包含任何账号凭证。clone 后按需在本地创建下列文件:
| 用途 | 本地文件 | 怎么配 |
|---|---|---|
| Twitter 抓取 | extract/accounts.db |
python extract/scripts/twitter_extract.py --setup |
| 微信公众号发布 | output/weixin_env |
cp output/weixin_env.example output/weixin_env,填入 WECHAT_APP_ID / WECHAT_APP_SECRET |
| 小红书发布 | output/xiaohongshu_env |
cp output/xiaohongshu_env.example output/xiaohongshu_env,填入 XHS_COOKIE |
| 代理(可选) | 见 extract/PROXY_CONFIG.md |
按本机网络环境配置;无需代理可留空 |
| GitHub API(可选) | 环境变量 GITHUB_TOKEN |
提高 GitHub 搜索限速 |
只跑抽取 + 筛选 + 出报告时,可不配微信 / 小红书;Twitter 源需要 accounts.db,关掉该源则可跳过。