Medido, não prometido

Idiomas misturados, salas reais, e os números por trás dos dois.

É isto que as tabelas abaixo dizem, antes de você lê-las: uma mistura roteada de modelos ganha de um único modelo de propósito geral justamente onde a fala fica difícil — outros idiomas, idiomas misturados, um celular em cima da mesa de uma sala. Cada número medimos nós mesmos, sobre datasets públicos que qualquer um pode baixar, e cada um vem com o tamanho da sua amostra ao lado. Nada nesta página é o release de um fornecedor.

Cada número é taxa de erro de palavra em nível de corpus — erros totais sobre palavras totais de referência — e é medido de novo toda vez que o roteamento muda. Menos é melhor.

Medido em áudio real

Datasets públicos, com nome — baixe você mesmo.

Google FLEURS, Multilingual LibriSpeech e o AMI Meeting Corpus. Os três são publicados sob licenças Creative Commons, então dá para te dizer exatamente quais trechos usamos e você pode baixar os mesmos. Estes são os números pelos quais a gente responde.

Sinsonte — uma mistura de modelos

O Sinsonte não roda um único modelo de transcrição. Cada gravação passa por uma mistura — parte dos modelos é nossa, parte é licenciada — e o roteador escolhe entre eles pelo idioma que está sendo falado e pela sala em que foi falado. Uma mistura de idiomas é o que obriga a uma mistura de modelos: um modelo por gravação se compromete com um idioma e escreve o resto da conversa como se também tivesse ouvido aquele idioma. E nenhum modelo ganha em tudo, ainda por cima: o que lidera em espanhol lido não é o que sobrevive a um celular esquecido em cima da mesa de uma reunião. Escolher certo, gravação por gravação, é o produto. Então esta coluna não reporta a nota de um modelo: reporta o que a mistura roteada entrega naquela condição.

Whisper large-v3 — o padrão aberto

O único modelo que a gente nomeia, e de propósito. É o que boa parte das ferramentas de transcrição roda por baixo, é download gratuito, e você pode reproduzir esta coluna sozinho sobre os mesmos clipes numa tarde. Uma referência que você consegue conferir vale mais do que cinco que você tem que acreditar — por isso é contra ela que a gente pede para ser medido.

A receita continua nossa

Quais modelos compõem a mistura, e como o roteador escolhe entre eles, a gente não publica: la receta es nuestra. Todo o resto continua reproduzível — os datasets, os splits, a semente de amostragem, os identificadores de cada clipe, a normalização do texto e a métrica estão publicados — e a coluna de referência é um download gratuito. Qualquer um pode rodar de novo e confirmar que o nosso número foi medido do mesmo jeito, sobre o mesmo áudio, no mesmo dia.

Taxa de erro de palavra, %, em nível de corpus. Menos é melhor. A ficha âmbar marca o número do Sinsonte.
Condição clipes min Sinsonte Whisper large-v3
FLEURS es-419 — espanhol latino-americano 22445.1 3.33.4
FLEURS pt-BR — português do Brasil beta 21045.2 5.15.7
FLEURS en-US — inglês 27745.1 4.85.7
MLS espanhol — narração de audiolivro 17745.1 2.84.1
MLS português — audiolivro, português europeu beta 17645.2 3.86.8
AMI-SDM — inglês, sala de reunião real, um único microfone distante 19418.0 12.823.9

Dito em palavras: com 3,3% em espanhol latino-americano, umas 97 de cada 100 palavras voltam exatamente como foram ditas. Em audiolivro em português, 3,8% contra os 6,8% da referência aberta são quase metade dos erros. E quanto mais o áudio se afasta de um estúdio, mais essa distância se abre — que é justamente por que a gente roteia.

12.8%

A sala é onde as ferramentas de graça caem.

O AMI-SDM é uma reunião real gravada por um único microfone em cima da mesa, com várias pessoas e sem headset: a condição para a qual o Sinsonte foi feito e a que os benchmarks costumam pular. Em 194 trechos (18 minutos), o Sinsonte marca 12,8% de taxa de erro de palavra contra 23,9% do Whisper large-v3: o mesmo áudio, quase metade dos erros. É a maior diferença desta página, e é a que importa, porque uma sala de reunião não é um caso raro — é uma terça-feira.

O que 12,8% parece na prática: mais ou menos uma palavra em cada oito que vale um segundo olhar, na condição mais difícil que existe — um celular do outro lado da sala de quem está falando. A referência aberta erra cerca de uma em cada quatro no mesmo áudio. E você nunca precisa caçar qual: cada linha leva o seu ▶ mm:ss, então conferir custa um toque.

As diferenças não são parelhas, e é aí que está o argumento. Áudio limpo e bem articulado é um problema resolvido: em espanhol lido qualquer um que saiba o que faz chega no mesmo lugar, a gente incluída. A mistura ganha o salário onde um único modelo de propósito geral para de dar conta: outros idiomas, idiomas misturados e salas. Três pontos em audiolivro em português; onze numa sala de reunião real. É ali que as suas gravações moram de verdade.

Separação de vozes — medida

Quem fala, medido do mesmo jeito que o que foi dito.

Acertar as palavras não serve de nada se elas forem atribuídas à pessoa errada. Cada gravação passa por uma etapa de separação de vozes antes de a transcrição começar, e a gente mede isso com o mesmo critério das tabelas acima: datasets públicos, rótulos de referência corretos, o mesmo arnês de pontuação em cada rodada.

DER — taxa de erro de diarização — é a fração do tempo total de uma reunião atribuída à voz errada, perdida como se não fosse fala, ou inventada como fala que nunca aconteceu. Não diz nada sobre o que foi dito, só de quem era a vez. Menos é melhor.

A etapa de separação de vozes do Sinsonte

Cada gravação passa por uma etapa de separação de vozes antes da transcrição, escolhida com o mesmo critério da mistura de transcrição: pelo que mede melhor de acordo com o tipo de sala de onde veio o áudio. A gente não diz qual motor é, pela mesma razão que não nomeia a mistura de transcrição: o roteamento é o produto.

O diarizador de código aberto líder

A ferramenta de separação de vozes de código aberto mais usada do mundo, grátis para baixar e rodar você mesmo sobre os mesmos datasets públicos. Igual ao Whisper nas tabelas acima, é a única referência desta página que a gente nomeia por categoria e não por produto, porque qualquer um pode reproduzi-la.

Taxa de erro de diarização, %, collar de 0,25 s (a convenção NIST/DIHARD). Menos é melhor. A ficha âmbar marca o número do Sinsonte.
Condição min Sinsonte Diarizador de código aberto
AMI Meeting Corpus — reunião real, inglês (amostra 1) 5.0 23.131.1
AMI Meeting Corpus — reunião real, inglês (amostra 2) 5.0 11.016.7
CallHome — ligação telefônica em espanhol 2.5 15.130.5
VoxConverse — inglês, áudio on-line (amostra 1) 1.4 14.411.4
VoxConverse — inglês, áudio on-line (amostra 2) 0.6 5.110.9
Média (n=5) 14.5 13.720.1

Dito em palavras: com uma média de 13,7% de DER, mais ou menos sete minutos em cada oito de uma reunião ficam com o falante certo; a referência de código aberto acerta isso em cerca de quatro em cada cinco. A maior distância está na única amostra em espanhol — uma ligação real, não sintética — onde a etapa do Sinsonte marca 15,1% contra 30,5%: praticamente metade da confusão.

15.1%

A única amostra em espanhol diz o mesmo que as tabelas acima.

callhome-spa-0 é uma ligação telefônica real em espanhol, não um diálogo de estúdio. A etapa de separação de vozes do Sinsonte marca 15,1% de DER contra 30,5% do diarizador de código aberto líder, sobre o mesmo áudio: metade da confusão, no idioma para o qual esta página inteira existe.

n=1. Uma ligação real em espanhol é evidência, não um estudo terminado — a mesma ressalva que esta página faz em todo o resto. Existem outros dois clipes do CallHome em espanhol e ficaram excluídos por completo: os dois falharam numa checagem básica de clipping antes de qualquer motor tocar neles, corrompidos na origem, não um resultado que nenhum lado ganhou.

Isso não ganha sempre, e mostramos a linha onde não ganha: em uma das cinco amostras a referência de código aberto marca menos (11,4% contra 14,4%, as duas em inglês, as duas do VoxConverse). Cinco amostras, um idioma além do inglês, é evidência real e não um estudo terminado — mais amostras de diarização em espanhol é a próxima coisa nesta lista, igual à afirmação de espanhol a distância acima.

Medido em estúdio · validação em curso

As misturas — onde a especialidade aparece.

Spanglish, portunhol, pt-en: frases que trocam de idioma no meio e não avisam ninguém. É para isto que o Sinsonte foi feito, e é onde a distância entre uma mistura roteada e um único modelo é a maior da página inteira.

Medido sobre diálogos de estúdio gerados por nós; a validação com gravações reais está em curso.

Taxa de erro de palavra, %, sobre o nosso próprio conjunto de referência — diálogos de estúdio, variante limpa. Amostras pequenas: n é por condição. As mesmas duas colunas de cima.
Condição clipes Sinsonte Whisper large-v3
Spanglish, trocando no meio da frase 3 1.13.1
Espanhol/inglês, trocando entre frases 4 7.349.6
Português + inglês, misturado beta 1 3.2
Portunhol — português + espanhol beta 1 9.8

A linha para olhar é a segunda. Uma conversa que troca de idioma entre frases é onde um único modelo se compromete com um idioma e escreve o resto como se também tivesse ouvido aquele idioma: erra mais ou menos uma palavra em cada duas. A mistura roteada erra cerca de uma em cada catorze. Em portunhol — dois idiomas perto o bastante para serem confundidos — é uma em cada doze contra uma em cada cinco.

FFER — taxa de erro por falso cognato

Quantas vezes um motor troca uma palavra pelo falso cognato do idioma vizinho em vez de escrever o que foi realmente dito. A gente construiu a métrica porque mais ninguém mede isso.

O espanhol e o português estão perto o bastante para que os motores de transcrição «consertem» um virando o outro em silêncio. Alguém falando portunhol diz que o status ficou em rojo — uma palavra em espanhol dentro de uma frase em português — e o motor escreve em vermelho, porque é o que uma frase portuguesa bem-comportada deveria dizer. Fluente. Plausível. Não é o que foi dito.

Isso custa uma palavra de erro e muda um fato. O Sinsonte escreve decisões e pendências direto da transcrição, então a gente construiu uma métrica para isso: a taxa de erro por falso cognato. As nossas gravações de referência carregam 25 armadilhas marcadas; em cada uma o modelo ou manteve o que foi falado, ou trocou pela palavra do outro idioma — essa troca é o FFER — ou destruiu a palavra, e isso último a gente deixa deliberadamente fora do numerador para que o ruído normal não infle o número.

20%

Até o melhor modelo sozinho reescreve um falso cognato em cada cinco.

Esse é o melhor que a gente já mediu, sobre portunhol limpo e com a armadilha marcada de antemão: quatro palavras em cada cinco sobrevivem, e a quinta vira caladinho a palavra do outro idioma. O pior motor que testamos reescreve sete em cada dez sem quase destruir uma sílaba: fluente, seguro de si, e não é o que foi dito.

Que é exatamente por que o Sinsonte não entrega o portunhol a um único modelo e depois dá a resposta como boa. Onde há um falso cognato em jogo a gente marca a palavra em vez de tomar partido em silêncio, e quem lê decide — com o ▶ ali mesmo para ouvir o que foi realmente dito.

Metodologia, datasets e limites

Pontuação

Taxa de erro de palavra em nível de corpus: erros totais divididos pelas palavras totais de referência daquela condição, não uma média de resultados por clipe. O texto é normalizado como o Open ASR Leaderboard faz, com uma mudança deliberada: os acentos e o ñ são preservados em vez de removidos, porque uma transcrição que os perde não é uma transcrição em espanhol. Cada hipótese fica guardada, então dá para pontuar de novo sem rodar áudio de novo.

Amostragem e escala

Semente 42 em tudo, uns 45 minutos de áudio por condição de áudio real e 18 minutos para a de sala de reunião: 1 258 trechos, 4,1 horas. Cada trecho passou por seis motores, e é daí que saem as 24,6 horas de avaliação desta página — 4,1 × 6. Os splits de teste do FLEURS são menores que o buffer de embaralhamento, então a amostra é uma permutação uniforme exata do split inteiro. O identificador de cada trecho fica escrito num manifesto, para qualquer um poder baixar e pontuar a mesma amostra de novo. A rodada publicada aqui rodou em 8 e 9 de agosto de 2026 e roda de novo toda vez que o roteamento muda.

Buracos conhecidos na amostragem

O índice da sala de reunião cobre cerca de 92,5% do split disponível: sete páginas do catálogo devolviam erro por limite de requisições enquanto ele era montado, e a gente seguiu em frente em vez de tentar de novo para sempre. A amostra continua semeada e reproduzível; só que sai desses 92,5%, e a gente prefere escrever esta frase a deixar você supor outra coisa.

Whisper large-v3, reconfirmado

Uma rodada de acompanhamento em 15 de agosto de 2026 testou de novo o Whisper large-v3 — junto com outros três modelos de transcrição que não aparecem nesta página — sobre amostras menores das mesmas famílias de clipes usadas acima: de 3 a 5 clipes por condição, com média por clipe em vez de nível de corpus. Confirmou que o Whisper large-v3 erra mais em toda condição que tocou: 4,5% em espanhol latino-americano e 3,6% em audiolivro em espanhol, os dois perto dos 3,4% e 4,1% publicados acima; 55,2% na troca de idioma espanhol/inglês entre frases, perto dos 49,6% de cima; e 8,5% no spanglish no meio da frase, bem acima dos 3,1% de cima. Dois resultados valem a pena dizer em voz alta em vez de diluir na média: em inglês limpo, o Whisper large-v3 devolveu uma transcrição vazia num clipe de 4,3 segundos que não está em silêncio — isso sozinho explica a maior parte de uma média bruta de 34,6%; tirando só esse clipe, cai para 18,2%, ainda pior que os 5,7% de cima. E em áudio real de sala de reunião a distância, os quatro clipes dessa rodada menor marcaram 61,0%, bem acima dos 23,9% da rodada maior de cima — as duas são medições genuínas do mesmo modelo aberto sobre áudio genuinamente difícil, não uma contradição para resolver. A mesma rodada ainda flagrou o Whisper large-v3-turbo traduzindo um clipe em espanhol para o inglês em vez de transcrever. Nada disso muda os números do Sinsonte publicados acima: foi uma rodada de confirmação só do Whisper, mantida separada aqui porque a amostra dela foi menor que o resto desta página.

Os datasets, e as licenças que nos deixam publicar isto

  • Google FLEURS

    Fala lida em 102 idiomas; usamos os splits de teste es-419, pt-BR e en-US.

    CC BY 4.0 · huggingface.co/datasets/google/fleurs

  • Multilingual LibriSpeech

    Narração de audiolivros; usamos os splits de teste de espanhol e português. O de português é português europeu, não brasileiro — parte do motivo de pontuar diferente.

    CC BY 4.0 · openslr.org/94

  • AMI Meeting Corpus

    Reuniões reais de várias pessoas gravadas em salas instrumentadas. Usamos o split de teste de microfone distante único — o áudio público mais parecido com um celular em cima da mesa.

    CC BY 4.0 · groups.inf.ed.ac.uk/ami/corpus

  • VoxConverse

    Áudio de vários falantes tirado de vídeo on-line, com os rótulos de turno de fala de referência. Usamos dois clipes do split de teste.

    CC BY 4.0 · github.com/joonson/voxconverse

  • CallHome (Spanish)

    Conversas telefônicas reais em espanhol, com os rótulos de turno de fala de referência. Licença de pesquisa, não redistribuível: podemos dizer qual ligação usamos, não entregar o arquivo.

    CC BY-NC-SA 4.0, research only · huggingface.co/datasets/talkbank/callhome

Os limites, ditos em voz alta

  • A gente não compara o Sinsonte com outros produtos. As duas colunas são coisas que rodamos nós mesmos, sobre os mesmos clipes no mesmo dia — um número copiado da página de marketing de um concorrente não é uma medição.
  • A gente não revela quais modelos compõem a mistura, nem como o roteador escolhe entre eles. É deliberado: o roteamento é o produto. O que a gente publica no lugar é o nosso próprio resultado ao lado de uma referência que qualquer um pode baixar e rodar de novo.
  • A gente não afirma ser o melhor em espanhol. Qual abordagem ganha muda com a condição, que é justamente a razão pela qual a gente roteia em vez de padronizar num único modelo.
  • A gente ainda não faz nenhuma afirmação sobre espanhol a distância: o AMI é em inglês, e é a nossa única gravação de sala genuinamente real. Gravar sessões consentidas em espanhol em salas barulhentas é a próxima coisa desta lista.
  • Os números de idiomas misturados são medidos sobre diálogos de estúdio gerados por nós, não sobre gravações do mundo real, e as amostras são pequenas: não existe dataset público de fala conversacional espanhol–inglês ou português–espanhol para o qual a gente tenha licença de publicar resultados. Três detalhes que valem: o 1,1% de spanglish no meio da frase se apoia num único clipe (os outros candidatos ficam entre 1,7% e 7,4%), a voz foi gerada por um sistema cujo fabricante também vende transcrição, e a linha de «entre frases» é montada colando gravações separadas uma atrás da outra, o que castiga qualquer modelo que trave em um idioma por clipe. A validação com gravações reais está em curso; estes números vão rotulados como medidos em estúdio em todo lugar onde aparecem, inclusive na nossa home.
  • Nenhum número desta página sai da gravação de um usuário. Nenhum, nunca: nem para medir, nem para treinar, nem para uma demo. Tudo aqui é dado público ou áudio que a gente fez de propósito.
  • As linhas de português misturado e portunhol acima foram atualizadas em 15 de agosto de 2026, depois de uma decisão de roteamento que moveu as duas condições para outro motor da mistura; os números novos são n=1 por condição, a mesma ressalva de sempre nesta seção. O Whisper large-v3 não foi testado nas gravações dessa rodada, então não mostramos número de referência para essas duas linhas em vez de emparelhar um número novo com um antigo de outra rodada.
  • Os números de separação de vozes da seção nova acima são taxa de erro de diarização, não taxa de erro de palavra, medidos sobre o próprio conjunto de cinco clipes de gravações públicas reais — uma amostra bem menor do que a que as tabelas de transcrição usam. Existem outros dois clipes em espanhol nesse dataset e ficaram excluídos por completo: os dois falharam numa checagem básica de clipping antes de qualquer motor tocar neles, corrompidos na origem. A referência de código aberto ganha em uma das cinco amostras (VoxConverse, 11,4% contra 14,4%), mostrada em vez de escondida.

O arnês de testes, o código de pontuação e o manifesto trecho a trecho ainda não são públicos — o repositório onde vivem também tem o produto. Estão disponíveis mediante pedido para quem quiser conferir um número: escreva para [email protected] e a gente manda.

← Voltar ao Sinsonte