Skip to content

Repository files navigation

Paper Digest

语音 / 音乐 / 音频论文速递自动化流水线

English · 中文

从 arXiv 与 HuggingFace Papers 抓取候选论文,经 LLM 筛选和多阶段全文分析,生成 每日汇总页、每篇中文深度解读,以及发布后的 TOP 10 论文长图和汇总封面。

你会得到什么

  • 一份可续跑、可审计的当日候选、筛选决定和深度分析数据。
  • 一篇每日汇总博客,以及每篇论文面向初学研究者的连续中文解读。
  • 完整作者机构与八维评分;原文存在且可验证时纳入公式、实验表格、论文图和复现资源。
  • 博客远端发布成功后生成的 TOP 10 论文长图与一张批次汇总封面。

默认行为

默认路线是 LLM/API,不是人工流程:

arXiv + HuggingFace
  → 关键词预筛 → LLM 逐篇筛选 → 封存本次官方 arXiv TXT/PDF
  → 多阶段全文分析与评分
  → 博客 generate → review → push / 远端 OID 验证
  → TOP 10 长图与汇总封面 → 最终状态验收
  • digest:preparedigest:api 是同一条默认路线。
  • 默认 API 日更在筛选结束、深度分析开始前,为每个入选 arXiv 论文封存本次官方文本和 PDF。每个 sealed source run 位于 data/runtime/daily-fresh-source-runs/<runId>/sources/<arxivId>/generation-000001/, 包含 source.txtsource.pdfsource-runtime.jsonsource-manifest.json。分析与 Reader 只能读取这组 已封存的文件;论文图仅在当前请求的 OS 临时目录物化,不写入 data/current/ 或 runtime 图片缓存。
  • Manual/人工高保障流程只有在明确选择时才启用;API、网络或配额失败不会自动切换。
  • 微信、飞书、小红书是可选集成,不属于默认日更。

全历史重写

全历史工作只在 audio-paper-digest-rewrite-all 工作区执行,采用 direct-local-first:arXiv 每个 generation 重取官方 TXT/PDF,会议重放已绑定 SHA 的本地 metadata/PDF;旧博客正文和旧分析不进入写作输入。 OpenReview 不可达时,替代来源仍默认失败关闭;唯一经代码白名单和用户授权的跨标题例外 n1mAjfRDZ6 可导入作者发布在 SSRN 的早期预印本,但分析输入、页面顶部和 staging manifest 都必须明示 “非 camera-ready”,并绑定来源标题、DOI、receipt 与 source SHA。

本地会议 metadata/PDF ─┐
                       ├→ direct-inputs → conference-projections → direct-plan
历史页已有 arXiv 链接 ─┘                                      ├→ direct-scheduler → direct-run → staging
                                                               └→ direct-aggregate

同一 canonical paper 只重写一次再投影到历史 URL;crosswalk 仅接收 fresh arXiv 获取失败产生的命名 handoff。 长任务可分批、查看状态、安全暂停和续跑。当前只支持私有 staging;历史 review、activation、push 和远端 OID 事务完成前不得覆盖博客。完整命令与恢复规则见历史重写底座

5 分钟开始

要求:Node >=20.18.1 <21 || >=22.3.0、Python 3.11+(OpenSSL 后端)及 Hugo 博客仓库。

# 1. 安装依赖
npm install
python3.11 -m venv .venv
.venv/bin/python -m pip install -r requirements.txt

# 2. 创建并按 docs/setup.md 填写项目配置
cp env.example .env

.env 至少配置模型 key/model/endpoint、HTTP CONNECT 代理和博客路径;完整字段与 sticky 备用账号规则见 环境配置。项目脚本必须在沙箱外运行。

# 3. 运行 Node 测试
npm test

# 4. 运行北京时间当天的完整脚本阶段
today="$(TZ=Asia/Shanghai date +%F)"
npm run digest:prepare -- "$today"

digest:prepare 会完成数据流程和博客发布,并准备视觉任务,但不会自行调用图像 API。 随后由 Codex 内置生图完成并目检视觉资产,或在用户明确取消时签发可审计豁免。

# 5. 最终验收
npm run digest:status -- --date "$today"

怎样才算完成

一次完整日更同时满足:

  1. 抓取来源、筛选决定和深度分析均为完整终态。
  2. 汇总页和全部论文页通过 review,博客提交已推送且远端 OID 匹配。
  3. TOP 10 长图与汇总封面均已登记,或存在绑定当前发布版本的显式视觉豁免。
  4. 最新 digest:status 不再报告未完成阶段。

博客已经发布后,视觉失败不会反向撤销博客,也不应触发博客重新生成或重新审查。

核心命令

目的 命令
默认当天日更 npm run digest:prepare -- YYYY-MM-DD
续跑未完成日更分析 npm run deep -- --date YYYY-MM-DD(只重放已封存的 TXT/PDF)
刷新 API Reader npm run api:reader:refresh -- --all --date YYYY-MM-DD --concurrency 5 --scoring-and-reader(只重放已封存的 TXT/PDF)
校验 current 数据 npm run validate:data
查看运行数据占用 npm run storage:status
预览引用感知清理 npm run storage:prune
查看最终状态 npm run digest:status -- --date YYYY-MM-DD
单独执行博客三阶段 npm run blog:generatenpm run blog:reviewnpm run blog:push
用户明确取消视觉 npm run digest:waive-visuals -- --date YYYY-MM-DD --reason "..."
显式 Manual 路线 npm run digest:manual -- YYYY-MM-DD

所有入口、参数和恢复语义见脚本说明;文件到职责的一页索引见 scripts/README.md

标签体系与只读历史预览

npm run taxonomy:validate
npm run taxonomy:preview
npm run taxonomy:serve

共享词表提供稳定ID、任务父子层级与分面。预览扫描项目配置中的Hugo仓库,保留旧标签及未映射项;界面支持父级查询、同分面“或”和跨分面“且”。所有结果只是历史标签的确定性映射,不是已审的论文语义重标,不会修改旧正文、评分或标签URL,也不调用论文模型API。服务只在本机回环地址开放静态预览,不是本机AI助手。

详见实施与验收计划标签设计

失败后从哪里继续

  • 抓取或筛选中断:直接重跑默认入口,健康 checkpoint 会复用。
  • 只有部分论文分析失败:运行 npm run deep -- --date YYYY-MM-DD,或按论文定向重分析。deepbatchreanalyzeapi:reader:refresh 只能精确重放当前 canonical 已绑定的 sealed TXT/PDF;它们不抓取、不补建 source run,也不读取 legacy text/cache。sealed source 缺失或 SHA 漂移时,重新运行 npm run digest:prepare -- YYYY-MM-DD
  • 博客审查或推送失败:修复后运行 npm run blog:review -- --date YYYY-MM-DDnpm run blog:push -- --date YYYY-MM-DD
  • 视觉任务缺失或失效:运行 npm run visual:post-publish -- --date YYYY-MM-DD,不要重发博客。
  • 不确定失败属于哪一层:先看排错手册主流程

从 fetch 开始只能绑定北京时间当天。历史批次必须基于已存在的受控数据,从相应恢复 阶段继续,不能伪造日期重新抓取。

架构概览

Node.js 数据层
  fetch / filter / deep analysis / state / visual manifests
                         ↓
Python 发布层
  Hugo generation / page review / Git transaction / remote verification
                         ↓
Codex 视觉层
  built-in image generation / visual QA / asset record

默认 API 与显式 Manual 共用博客发布和视觉边界,但内容证据与 provenance 独立,不能混批。 Manual 的脚本、Prompt、测试和工作流集中在 manual/

数据与输出

位置 内容
data/current/ 当前候选、筛选、分析、发布凭证和视觉任务状态
data/archive/<date>/ 每日数据快照与最终视觉资产
data/runtime/daily-fresh-source-runs/ 日更筛选后封存、供分析/Reader 重放的官方 TXT/PDF source runs
data/runtime/fetched-arxiv-sources/ 历史 direct arXiv generation 重新抓取并封存的官方 TXT/PDF source runs
data/runtime/ 的其他历史子目录 历史 direct plan、analysis、单页 staging 与汇总 staging;不写入博客仓库
logs/ 脱敏后的运行日志,可在 .env 中关闭文件日志
Hugo 博客仓库 汇总页、论文页、主题模板与发布提交

字段和跨文件一致性见数据格式

开发与维护

npm run test:default       # 默认 API 与共享 Node 测试
npm run test:manual        # 显式 Manual Node 测试
npm test                   # 两者一起运行

CI 还运行 Python 单测、JS/Python/shell 语法检查和空数据结构校验。修改配置、评分、 Prompt 或持久化契约前,请阅读维护约定

文档导航

About

No description, website, or topics provided.

Resources

Stars

41 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages