For the complete documentation index, see llms.txt. This page is also available as Markdown.

Serviço de voz

Facephi Voice Service é um serviço API REST ao qual podem ser enviados arquivos de áudio para processamento e obter o resultado do processo de reconhecimento de voz. O serviço oferece uma funcionalidade para registrar (enroll) uma nova voz e outra para autenticar uma voz.

O produto é voltado para a verificação de falante (speaker verification) e para a detecção de vida em voz (voice liveness detection). Ele se baseia no uso de um modelo de voz (voice template), uma sequência de texto que contém as informações biométricas da voz. Esse modelo de voz pode ser usado para autenticar as vozes no futuro.

A autenticação JWT opcional pode ser habilitada na inicialização a partir de config.json ou por meio das variáveis de ambiente FACEPHI_VOICE_REST_AUTH_*. Quando o JWT está habilitado, GET /api/v1/version e GET /api/v1/health continuam públicos, enquanto os endpoints protegidos exigem um JWT válido. A configuração de inicialização do JWT nunca é exposta por meio de GET /api/v1/config nem pode ser modificada por meio de POST /api/v1/config.

Os formatos de áudio suportados são:

  • WAV

  • MP3

  • Opus/OGG

  • AAC

  • WMA

  • PCM ulaw e mulaw

  • FLAC

  • ALAC (mov)

  • MP4

  • AIFF

A distribuição principal contém os seguintes recursos:

  • Contêiner Docker. O contêiner está disponível no repositório Docker da Facephi e é baseado no Ubuntu 24.04. O contêiner inclui o serviço e todas as dependências necessárias para executá-lo.

  • Documentação online. A documentação está disponível no seguinte URL: https://doc-voice-service.facephi.dev/

Atualizado