面向体育赛事录像的自动字幕与高光剪辑展示工作台。它复用了已有的四阶段处理链路:字幕/音频解析、双模态高光检测、语义化精剪、字幕烧录与渲染。
python -m pip install -r requirements.txt
python -m uvicorn app:app --reload --port 8000打开 http://127.0.0.1:8000,上传赛事视频,设置成片时长并开始处理。
- Python 3.11+
- FFmpeg:必须安装并加入系统 PATH(Windows 可用
winget install Gyan.FFmpeg) - CUDA(可选):推荐 NVIDIA 显卡以加速 Whisper、OCR 与视觉分析;无显卡时回退到 CPU
本仓库不包含 yolo26n.pt(团队视觉分析模块所需的 YOLO 检测权重,约 5 MB)。
请从原工程包获取该文件,并将其放置于仓库根目录,程序即可正常加载。
若缺失该文件,team_visual_agent 会在运行时提示模型未找到。
- 本仓库代码中不包含任何硬编码的 API Key、Token 或密码。
config.py中的 LLM / DeepSeek API Key 均通过环境变量(DEEPSEEK_API_KEY、LLM_API_KEY)读取,默认值为空。- 网页端填写的 Token Plan API Key 仅用于本次会话,通过内存临时传入,不会写入任何本地文件。
- 请勿将个人密钥填入代码或提交到版本控制;如需持久化,仅在本地创建
.env文件并加入.gitignore。
- 先展示「处理工作流」和候选卡片如何解释模型决策。
- 上传一段 1–3 分钟的视频;本机首次运行 Whisper 会下载模型。
- 成片生成后,用预览区播放并展示候选的时间区间、关键词和评分。
API Key 是可选项;不填写时仍使用本地字幕、音量突增和关键词完成高光筛选。