blog AI Business

O Japão Não Pode Ser Subestimado! A Maravilha dos Modelos Izanami + Kushinada + BERT

Uma análise profunda dos modelos de fala japoneses 'Izanami' e 'Kushinada' do AIST. Descubra os benchmarks e o futuro da IA no país.


Na corrida global de desenvolvimento de IA, a "barreira linguística" do japonês tem sido às vezes um obstáculo, e às vezes o solo para uma evolução única. De 2025 a 2026, a comunidade japonesa de IA de reconhecimento de fala tem altas expectativas para o "Izanami" e o "Kushinada", modelos de base de fala japonesa desenvolvidos pelo AIST (National Institute of Advanced Industrial Science and Technology).

Com o Whisper da OpenAI varrendo o mundo, o reconhecimento de fala é frequentemente pensado como um "problema resolvido". No entanto, nas profundezas da língua japonesa, muitos desafios permaneciam. Desvendando os resultados de benchmark mais recentes, explicamos detalhadamente os recursos surpreendentes do "Izanami/Kushinada + BERT", que abre um novo horizonte para a entrada de fala japonesa, e o cenário onde a IA doméstica supera os concorrentes estrangeiros.

1. O Contexto de 'Izanami e Kushinada': Por que Modelos de Base Domésticos São Necessários

Até agora, o reconhecimento de fala japonês foi dominado por modelos estrangeiros, como o Speech-to-Text da Google e o Whisper da OpenAI. Embora altamente poderosos, esses modelos priorizam o suporte a vários idiomas, às vezes falhando em capturar nuances exclusivas do japonês, como a abundância de homófonos, o uso delicado de partículas e omissões dependentes do contexto.

Particularmente em ambientes de negócios, governamentais e de saúde no Japão, altos níveis de segurança são exigidos juntamente com uma comunicação estrita onde o erro de reconhecimento é inaceitável. Havia um dilema: a IA baseada em nuvem estrangeira levantava preocupações sobre o vazamento de dados para o exterior, enquanto executá-la localmente exigia recursos computacionais massivos.

Os modelos "Izanami" e "Kushinada" do AIST aprenderam com aproximadamente 60.000 horas de dados de fala japonesa, a maior escala do país. Esse volume de dados é esmagadoramente evidente quando comparado aos modelos domésticos anteriores, que estavam na faixa de centenas a milhares de horas. Ao absorver uma ampla variedade de "japonês vivo" de transmissões de TV, atas de reuniões e conversas diárias, um "ouvido japonês" que soa natural para falantes nativos foi aperfeiçoado.

2. Anatomia Técnica: wav2vec 2.0 do Izanami e HuBERT do Kushinada

Como sugerem os nomes derivados da mitologia japonesa — Izanami (a criadora) e Kushinada (a apoiadora) — esses dois modelos têm papéis claramente projetados.

Izanami: O Ápice do Aprendizado Auto-Supervisionado

O "Izanami" é baseado no "wav2vec 2.0" proposto pela Meta. Este é um método para aprender as regularidades da própria fala a partir de vastas quantidades de dados de áudio sem rótulos (texto correto). O Izanami é responsável por construir a "força física básica" da fala japonesa e é otimizado como base para o ajuste fino em jargões de setores específicos.

Kushinada: Inteligência que Captura Significado e Contexto

Em contraste, o "Kushinada" adota a tecnologia "HuBERT (Hidden-Unit BERT)", que aplica a estrutura BERT da Google à fala. Ele converte sinais de fala em tokens discretos chamados "unidades ocultas" e prevê o próximo som com base no contexto circundante, aprendendo profundamente não apenas os recursos acústicos, mas também a conexão de significados linguísticos. Como resultado, ele atinge uma taxa de precisão de 84,77% no reconhecimento de emoções (alegria, raiva, tristeza, normal), superando significativamente os modelos anteriores (cerca de 70%).

3. Benchmarks Provam a Força da Tecnologia Nacional: Rivalizando com o Whisper large-v3

Então, qual é o desempenho real? Os testes realizados mostraram-se bastante promissores. A tabela abaixo compara a precisão do reconhecimento de fala japonesa dos principais modelos.

Nome do Modelo

Precisão de Caracteres (Character Accuracy)

Taxa de Erro de Caracteres (CER)

Tempo de Processamento

OpenAI Whisper large-v3

81.2%

18.8%

14.04 s

Kushinada-Hubert (Bruto)

76.1%

23.9%

128.96 s

Kushinada + BERT Punctuation

81.0%

19.0%

0.11 s (BERT)

O que vale a pena notar é que a adição da Restauração de Pontuação usando o BERT japonês ao resultado de reconhecimento do Kushinada (76.1%) fez a **Precisão de Caracteres saltar para 81.0%**. Isso é quase comparável aos 81.2% do Whisper large-v3, o campeão reinante de IA de reconhecimento de fala. Enquanto o Whisper depende de força bruta com um número massivo de parâmetros, a combinação Kushinada+BERT atinge uma saída **mais leve** e altamente precisa por meio de sua especialização na língua japonesa.

4. Sinergia com o BERT: De Mero Transcrição para 'Geração de Sentenças'

A combinação de "Kushinada + BERT" é poderosa porque não apenas converte sons em texto; ela melhora drasticamente a legibilidade como sentenças. Os dados brutos gerados por modelos de reconhecimento de fala são frequentemente uma sequência de caracteres sem pontuação. Ao interpor o BERT, que entende profundamente o contexto japonês, vírgulas e pontos apropriados são inseridos de acordo com o contexto.

5. A Força de Executar em um Ambiente Local

Em ambientes que lidam com informações altamente confidenciais, como os setores médico, judicial e parlamentar, enviar áudio para IA de nuvem externa é difícil. Um sistema baseado em "Izanami/Kushinada" pode ser executado em servidores locais desconectados da internet. Você pode desfrutar do nível de precisão mais alto do mundo enquanto **protege a privacidade**. Este é o maior valor oferecido pelos modelos domésticos.

[Fontes]


1. Comunicado Oficial do AIST sobre o Lançamento dos Modelos de Fala Japonesa 'Izanami' e 'Kushinada'
2. Ledge.ai: AIST Anuncia o Maior Modelo Doméstico de IA de Fala com 60.000 Horas de Treino
3. Artigo no Note sobre Validação de Capacidades do Kushinada e Melhoria pelo BERT