Projeto · Transcrição e áudio
Transcrição de 132 reuniões com Whisper em GPU local
Eram 132 reuniões comerciais para transcrever sem mandar o áudio para uma API. Transcrevi as 66h42 de áudio em 4h26, na minha própria GPU. Nenhum áudio saiu da máquina, e o custo de API foi zero.
- Cliente
- Reduzzi Brasil
- Meu papel
- Construí e operei
- Estado
- Concluído. As 132 reuniões foram transcritas

Contexto
Reuniões gravadas, ainda em áudio
A Reduzzi Brasil tinha 132 reuniões comerciais gravadas. Para analisar o que foi dito, primeiro era preciso transformar o áudio em texto.
O problema
Transcrever sem mandar a conversa para fora
Eram 66h42 de conversa comercial, e a transcrição precisava acontecer sem mandar o áudio para uma API. Além disso, o robô de transcrição que já existia estava com uma fila de 655 áudios.
Meu papel
Construí e operei
Levei a transcrição para a GPU da minha própria máquina. Montei a rotina local e rodei a fila até o fim.
A virada
Whisper na GPU, com fila que retoma
- Rodei o faster-whisper, uma versão otimizada do Whisper, na GPU da minha máquina.
- Escrevi a rotina em Python, com fila retomável. Se a máquina parar no meio, ela continua de onde estava.
- Processei as 132 reuniões sem enviar nenhum áudio para fora.
- Zerei a fila do robô de transcrição, que estava com 655 áudios.
Resultado
Tempo, custo e fila
- 66 horas e 42 minutos de áudio em 4 horas e 26 minutosDe áudio transcrito, somando as 132 reuniões.
- 132 reuniõesTodas transcritas.
- Custo de API zeroNenhum áudio foi enviado para serviço externo.
- 655 para 0Áudios na fila do robô de transcrição, antes e depois.
O tempo de máquina ficou em cerca de um quinze avos da duração do áudio.
Limites
O que este projeto não prova
- O caso prova tempo e custo. Não tenho medida de acurácia da transcrição.
- "Custo de API zero" não quer dizer custo zero. A GPU e a energia são minhas.
- O resultado vale para esta GPU e para este volume. Não é comparação com serviços pagos.
Stack
- Python
- Whisper
- faster-whisper
- GPU local