Repositório com provas de conceito para comparar APIs de reconhecimento de fala e transcrição de áudio.
As POCs exploram transcrição de áudio em tempo real e processamento de arquivos de áudio usando provedores diferentes.
poc-aws: integração com Amazon Transcribe.poc-aws-webpack: integração inicial com Amazon Transcribe usando Webpack.poc-azure: integração com Microsoft Azure Speech-to-Text.poc-gcloud: integração com Google Cloud Speech-to-Text.poc-openapi: transcrição de arquivos com OpenAI Whisper.
poc-aws/ Amazon Transcribe
poc-aws-webpack/ Amazon Transcribe com Webpack
poc-azure/ Microsoft Azure Speech-to-Text
poc-gcloud/ Google Cloud Speech-to-Text
poc-openapi/ OpenAI Whisper
docs/ Documentação complementar
Mais detalhes:
docs/ESTRUTURA.md
Entre na pasta da POC desejada:
cd nome-da-pocInstale as dependências:
npm installExecute o projeto:
npm startArquivos .env reais não devem ser enviados ao GitHub.
Para a POC Azure, crie o arquivo local a partir do exemplo:
cp poc-azure/.env.example poc-azure/.envDepois preencha:
AZURE_SPEECH_KEY=
AZURE_REGION=
Para testar a poc-gcloud, use Credenciais Padrão de Aplicativo:
gcloud auth application-default loginA API Whisper Speech-to-Text é voltada para transcrição de arquivos de áudio pré-gravados. Ela não é indicada para transcrição em tempo real via streaming contínuo.
Para transcrição em tempo real, use APIs com suporte a streaming:
- Google Cloud Speech-to-Text
- Microsoft Azure Speech
- Amazon Transcribe