VoiceFlow é um kit de ferramentas local e poderoso para processamento de áudio, transcrição inteligente e síntese de voz baseada em Inteligência Artificial. Projetado com uma interface moderna e dark mode responsiva via Eel, o VoiceFlow integra modelos avançados como Faster-Whisper e F5-TTS para oferecer resultados profissionais de forma local.
- Extração de Áudio: Separe trilhas de áudio de arquivos de vídeo de forma automática usando FFmpeg.
- Transcrição Inteligente: Transcreva áudio e vídeo usando o Faster-Whisper com suporte a aceleração por hardware (GPU/CUDA) ou CPU.
- Legendas no Estilo TikTok: Gere legendas dinâmicas curtas e de leitura rápida, ideais para vídeos de formato curto (Reels, TikTok, Shorts). Customize:
- Quantidade Máxima de Palavras: Limite de palavras por linha (ex: 3 palavras).
- Duração Máxima: Limite de tempo por legenda (ex: 1.5 segundos).
- Formatos de Exportação: Texto simples (
.txt), legendas estruturadas (.srt) e WebVTT (.vtt). - Visualização em Tempo Real: Veja os blocos transcritos na tela conforme o áudio é processado.
- Vozes Neurais de Alta Qualidade: Utiliza o motor do
edge-ttspara gerar falas extremamente naturais em português e dezenas de outros idiomas. - Controle Dinâmico: Ajuste a velocidade da fala (Speed) e o tom da voz (Pitch).
- Player Embutido: Ouça o áudio gerado diretamente pela interface antes de exportar.
- Modelos de Ponta: Suporta o modelo original F5-TTS e a versão especializada em Português Brasileiro (
firstpixel/F5-TTS-pt-br). - Auto-Transcrição: Transcreva o áudio de referência automaticamente com Whisper com apenas um clique.
- Filtros Integrados: Remoção de ruído de fundo do áudio de referência e remoção de silêncios do áudio gerado.
Para rodar o VoiceFlow localmente, você precisará de:
- Python 3.10+
- FFmpeg (gerenciado automaticamente pelo pacote
imageio-ffmpeg) - CUDA Toolkit (opcional, recomendado para GPU):
- Para aceleração na transcrição e clonagem de voz F5-TTS.
eel(Frontend HTML/JS + Backend Python)faster-whisper(Transcrição veloz)f5-tts(Clonagem de voz via Flow Matching)edge-tts(Síntese de voz da Microsoft)noisereduce&num2words(Tratamento e pré-processamento de áudio)
-
Clone o repositório:
git clone https://github.com/seu-usuario/tiktok-dark-tools.git cd tiktok-dark-tools -
Crie e ative um ambiente virtual:
python -m venv venv # No Windows (PowerShell): .\venv\Scripts\Activate.ps1 # No Linux/macOS: source venv/bin/activate
-
Instale as dependências:
pip install -r requirements.txt
-
Inicie o aplicativo:
python main.py
O VoiceFlow já vem pré-configurado para localizar bibliotecas NVIDIA CUDA instaladas no próprio ambiente Python. Se você deseja transcrever e clonar vozes de forma instantânea usando sua GPU GeForce:
- Certifique-se de que sua placa é compatível com CUDA e que os drivers da NVIDIA estão atualizados.
- Ao selecionar o dispositivo GPU (CUDA) na interface do programa, ele utilizará as bibliotecas CUDA pré-carregadas instaladas via pip (
nvidia-cublas-cu12, etc).
Este projeto é distribuído sob a licença MIT. Consulte o arquivo LICENSE para obter mais informações.
