一个在 Apple 芯片 Mac 上本地运行的语音克隆网页工具。上传已获授权的参考音频,输入文字,即可生成相似音色的中文或多语言语音。
Caution
本项目只允许克隆使用者本人的声音,或已获得声音本人明确、知情、可撤回授权的声音。严禁用于冒充、欺骗、诈骗、骚扰、伪造证据、政治操纵、规避身份认证或声纹验证。使用者必须遵守所在地法律,并对输入素材与生成内容承担全部责任。
- 本地运行:音频不上传到第三方服务
- 网页界面:不需要编写命令
- 中文友好:基于 Qwen3-TTS Base 模型
- 零样本克隆:无需训练,只需一段干净参考音频
- 隐私优先:参考音频与输出文件默认不纳入 Git
- 授权确认:生成前必须确认已取得声音本人授权
- Apple 芯片 Mac(M1 或更新)
- macOS 14 或更新版本
- Python 3.10–3.12
- 建议至少 16 GB 内存
- 首次使用需联网下载约 2 GB 模型,之后可离线生成
git clone https://github.com/bbosoo/local-voice-clone-studio.git
cd local-voice-clone-studio
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
python app.py应用启动后会自动打开本地网页。
- 使用 10–45 秒无背景音乐、无混响、只有一个人说话的录音。
- 同时填写参考音频的准确原文。
- 参考音频和目标文字使用相似的语言、语气和录音风格。
- 多人对话应先分离目标说话人的片段,不能直接上传整段。
- 上传内容只在本机处理。
- 输出文件存放在
outputs/,该目录已被.gitignore排除。 - 仓库不附带任何真人声纹、示例人声或模型权重。
- 请勿将参考音频、生成音频或模型缓存提交到公开仓库。
仅限以下场景:
- 克隆自己的声音;
- 已获得声音本人明确、知情的授权;
- 配音、无障碍辅助、创作和内部测试等合法用途。
禁止用于冒充、欺骗、诈骗、骚扰、制造虚假证据、绕过身份或声纹验证,以及任何未经声音本人同意的用途。使用者需自行承担法律与伦理责任。
使用本项目即表示你确认:
- 对参考声音拥有合法处理权限;
- 已向声音本人说明用途、保存方式和潜在风险;
- 会在发布合成音频时进行必要的 AI 生成标识;
- 收到声音本人撤回授权后,将停止生成并删除相关参考素材;
- 不会将本项目用于高风险身份验证、金融交易或公共决策场景。
发现安全漏洞或疑似滥用时,请遵循 安全与滥用举报政策,不要在公开 Issue 中发布真人声纹、个人信息、令牌或可直接复现伤害的材料。
- 推理框架:MLX-Audio
- 默认模型:
mlx-community/Qwen3-TTS-12Hz-0.6B-Base-8bit - 项目许可证:MIT