Pular para o conteúdo

Áudio (planejado)

A aba Multimodal tem um terceiro card, Áudio, sempre exibido em cinza (desabilitado) — ao contrário de Imagens e Arquivos, não há interruptor para ligar.

Duas lacunas reais impedem que esse card funcione hoje:

  1. Sem sinalização de suporte no catálogo de modelos. As colunas que existem hoje (supportsImages, por exemplo) permitem checar se um modelo aceita visão nativamente, mas não existe uma coluna equivalente para áudio — não há como o editor confirmar, para nenhum modelo, que o envio nativo de áudio funcionaria.
  2. Sem transcrição via modelo auxiliar. A alternativa a suporte nativo seria transcrever o áudio para texto antes de enviar ao modelo principal (o mesmo tipo de “pré-processamento” que também não existe ainda para imagens/arquivos) — isso exigiria escolher e integrar um modelo auxiliar de transcrição, o que não foi implementado nesta entrega.

Por isso a política de áudio é sempre recusar, sem exceção, e não há nada a configurar neste card por enquanto.

Não há substituto direto para anexar um áudio no chat hoje. Se o conteúdo do áudio precisa informar as respostas do agente, a alternativa é transcrevê-lo manualmente (fora da plataforma) e enviar o texto resultante como mensagem comum, ou como um documento numa Base de Conhecimento.