Projeto · Transcrição e áudio

Transcrição de 132 reuniões com Whisper em GPU local

Eram 132 reuniões comerciais para transcrever sem mandar o áudio para uma API. Transcrevi as 66h42 de áudio em 4h26, na minha própria GPU. Nenhum áudio saiu da máquina, e o custo de API foi zero.

Cliente
Reduzzi Brasil
Meu papel
Construí e operei
Estado
Concluído. As 132 reuniões foram transcritas
Diagrama: ondas de som viram linhas de texto dentro de um perímetro fechado, do qual nada sai.

Contexto

Reuniões gravadas, ainda em áudio

A Reduzzi Brasil tinha 132 reuniões comerciais gravadas. Para analisar o que foi dito, primeiro era preciso transformar o áudio em texto.

O problema

Transcrever sem mandar a conversa para fora

Eram 66h42 de conversa comercial, e a transcrição precisava acontecer sem mandar o áudio para uma API. Além disso, o robô de transcrição que já existia estava com uma fila de 655 áudios.

Meu papel

Construí e operei

Levei a transcrição para a GPU da minha própria máquina. Montei a rotina local e rodei a fila até o fim.

A virada

Whisper na GPU, com fila que retoma

  • Rodei o faster-whisper, uma versão otimizada do Whisper, na GPU da minha máquina.
  • Escrevi a rotina em Python, com fila retomável. Se a máquina parar no meio, ela continua de onde estava.
  • Processei as 132 reuniões sem enviar nenhum áudio para fora.
  • Zerei a fila do robô de transcrição, que estava com 655 áudios.

Resultado

Tempo, custo e fila

  • 66 horas e 42 minutos de áudio em 4 horas e 26 minutosDe áudio transcrito, somando as 132 reuniões.
  • 132 reuniõesTodas transcritas.
  • Custo de API zeroNenhum áudio foi enviado para serviço externo.
  • 655 para 0Áudios na fila do robô de transcrição, antes e depois.

O tempo de máquina ficou em cerca de um quinze avos da duração do áudio.

Limites

O que este projeto não prova

  • O caso prova tempo e custo. Não tenho medida de acurácia da transcrição.
  • "Custo de API zero" não quer dizer custo zero. A GPU e a energia são minhas.
  • O resultado vale para esta GPU e para este volume. Não é comparação com serviços pagos.

Stack

  • Python
  • Whisper
  • faster-whisper
  • GPU local