Skip to content

Repository files navigation

IndustryInfo

一个本地优先、可迁移的 Windows 行业资讯阅读器,用于聚合、筛选、阅读、批注和复盘中国云计算、人工智能与通信行业信息。

Version Python Platform License

IndustryInfo 希望解决一个具体问题:行业信息散落在运营商、云厂商、技术社区和媒体网站中,浏览器阅读难以保留统一的历史、批注和摘录,重复搜索又耗时。它把信息发现、原网页阅读和个人知识沉淀放在同一个桌面程序中,同时将数据保留在本地。

使用界面

IndustryInfo 阅读界面:左侧资讯目录,右侧文章正文与批阅区域

截图使用完全隔离的演示数据,不包含真实账号、浏览记录、个人批注或第三方文章正文。

当前版本为 v0.3.0,适合个人研究和持续迭代,尚未提供官方预编译安装包。

核心能力

  • 统一阅读入口:左侧浏览筛选后的文章,右侧通过 Qt WebEngine 显示原始网页。
  • 渐进式采集:先呈现可用内容,再继续采集剩余来源,减少等待和内存占用。
  • 本地情报筛选:对候选文章评分,优先保留平台发布、核心技术、规模落地、战略经营和社会影响信息。
  • 批阅与摘录:记录个人想法,保存网页选中文本,并关联文章标题和原始链接。
  • 主页阅读模式:对不适合自动采集的网站,直接浏览主页并记录当前文章。
  • 阅读复盘:按时间整理已读文章、批阅和摘录,形成可追溯的阅读记录。
  • 可选大模型筛选:支持 OpenAI 兼容接口;调用失败时自动回退到本地规则。
  • 本地优先与便携迁移:SQLite、浏览器状态和阅读资料都位于项目数据目录,可在关闭程序后整体复制。
  • Windows 桌面应用:不启动 Web 服务,不依赖固定 IP 或端口,可构建为独立的 exe 文件夹。

界面与工作流

程序包含三个主要页面:

页面 用途
阅读 浏览文章目录和原网页,标记有价值内容,保存批阅与摘录
信息源 添加、删除、启停信息源,打开来源主页,配置筛选规则
复盘 汇总指定时间内的阅读记录、批阅和摘录

典型使用流程:

  1. 在“信息源”页采集已启用来源,或打开一个技术社区主页。
  2. 在“阅读”页选择文章;打开后会自动记录为已读。
  3. 对重要文章标记“有价值”,在阅读过程中保存批阅和摘录。
  4. 在“复盘”页选择时间范围,生成阅读汇总。

快速开始

系统要求

  • Windows 10 或 Windows 11,64 位
  • 可访问 Python 官方下载站和 PyPI 镜像的网络
  • 首次安装建议预留至少 1.5 GB 磁盘空间,主要用于 Python、PySide6 和 Qt WebEngine

方式一:项目独立运行时

克隆仓库:

git clone https://github.com/marswy163/industry-info-reader.git
cd industry-info-reader

首次使用双击:

setup_runtime.bat

该脚本会把 Python 3.12 安装到项目内的 runtime\python312,并通过清华 PyPI 镜像安装依赖。完成后双击:

start.bat

方式二:已有 Python 3.12

开发者也可以使用虚拟环境:

py -3.12 -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install -r requirements.txt
python IndustryInfoQt.py

首次启动会自动创建本地数据库。若需要重新写入默认来源:

python seed_sources.py

默认信息源

项目预置两类来源。

常规采集来源

  • 天翼 AI 新闻中心
  • 华为云新闻报道
  • 百度智能云新闻资讯
  • InfoQ 中国
  • 量子位
  • 华为云开发者社区
  • C114 通信网

主页阅读来源

  • 开发者头条
  • 机器之心
  • 智源社区
  • PaperWeekly
  • 阿里云开发者社区
  • 腾讯云开发者社区
  • 字节跳动技术团队
  • 移动 Labs

主页阅读来源不参与“采集全部”,以避免动态页面、登录或反自动化机制拖慢采集。在“信息源”页双击来源即可打开主页;进入文章后程序会尝试自动识别,也可以点击“记录当前页”手动保存。

默认信息源只是可编辑的起点。网站结构和访问策略可能变化,项目不保证任何第三方来源始终可采集。

筛选机制

每篇候选文章会得到 0-100 的价值评分、分类和判断理由,默认达到 55 分才进入阅读列表。本地规则主要排除维护、计费、促销、开服、停服和普通功能更新等低价值内容。

如需大模型二次筛选,可在“信息源 > 筛选设置”中填写:

  • OpenAI 兼容接口地址
  • API Key
  • 模型名称
  • 是否启用大模型二次筛选

接口不可用时会自动回退到本地规则。手工标记为有价值、已有批阅或已有摘录的文章,不会因规则变化从列表中消失。

数据与隐私

所有个人数据默认保存在本机:

data/
├── industry_info.sqlite3   # 信息源、文章、批阅、摘录、设置和复盘
└── browser_profile/        # Cookie、历史记录、缓存和登录状态

请特别注意:

  • SQLite 数据库目前没有加密。
  • 信息源密码、Cookie 和大模型 API Key 可能以明文保存在本地数据库中。
  • 不要把 data/、backups/ 或个人使用过的 dist/ 上传到公开仓库或发送给他人。
  • .gitignore 已排除这些目录,但无法防止绕过 Git 的手工上传。

关闭软件后,可以通过复制整个项目目录迁移源码运行环境。使用打包版时,应复制完整的 dist\IndustryInfo 文件夹,不要只复制 exe。

更多信息见 安全说明。

构建 Windows 版本

先完成运行时安装,然后双击:

build_exe.bat

构建结果位于:

dist\IndustryInfo\IndustryInfo.exe

Qt WebEngine 需要携带浏览器运行组件,因此打包目录会明显大于普通 Python 工具。当前构建脚本偏向个人迁移:如果发现已有打包数据,会先备份并恢复它。制作公开 Release 时,必须在干净的数据目录中重新构建,避免夹带个人笔记、Cookie 或凭据。

项目结构

IndustryInfo.py       SQLite、采集、正文抽取、筛选和复盘后端
IndustryInfoQt.py     PySide6 桌面界面和 Qt WebEngine 浏览器
seed_sources.py       默认信息源定义与初始化
requirements.txt      Python 依赖
setup_runtime.bat     安装项目独立 Python 运行时
start.bat             启动桌面程序
build_exe.bat         构建可迁移的 Windows 应用目录
data/                 本地数据库与浏览器数据,不进入 Git
backups/              本地备份,不进入 Git

已知限制

  • 当前主要面向 Windows,尚未系统验证 macOS 和 Linux。
  • 验证码、短信验证和复杂单点登录需要在内嵌浏览器中人工完成。
  • 部分网站会阻止自动采集,但可能仍可在右侧浏览器中正常阅读。
  • 网站 DOM 改版后,对应目录发现和正文抽取规则可能需要更新。
  • 当前没有加密本地凭据,也没有多设备自动同步和冲突合并。
  • 大模型能力目前用于二次筛选,复盘仍是确定性的本地阅读汇总。

路线图

  • 改进信息源适配器和失败诊断
  • 提供不包含个人数据的 Windows Release 构建流程
  • 为采集、筛选和数据库迁移补充自动化测试
  • 增强导出、备份校验和跨设备合并能力
  • 在用户明确选择后,为阅读复盘增加可追溯的大模型分析

路线图会根据真实使用反馈调整。功能建议和来源适配问题可通过 Issues 提交。

参与贡献

欢迎提交错误报告、信息源适配、正文抽取改进和文档修正。提交代码前请阅读 贡献指南。

采集和展示第三方网站内容时,请遵守目标网站的服务条款、robots 规则、版权要求和适用法律。本项目不附带任何第三方内容,也不代表所列信息源。

版本记录

版本变化见 CHANGELOG.md。

License

本项目采用 MIT License。

About

本地优先的 Windows 行业资讯阅读器:聚合、筛选、批注并复盘云计算、AI 与通信行业信息。

Topics

Resources

Contributing

Security policy

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages