bukib
0 bukibs
Columbus, Ohio
Hora local: 06:48
Temperatura: 18.3°C
Probabilidade de chuva: 0%

Google Desenvolve “Truque” para Acelerar Inteligência Artificial em Celulares

O Google recentemente anunciou o Gemma 4, seu modelo aberto de inteligência artificial (IA) com raciocínio mais avançado, voltado ao uso em bots inteligentes. No entanto, essa potência pode resultar em maior consumo de recursos e respostas mais lentas. Para resolver essas limitações, a empresa desenvolveu um novo “truque” técnico que permite que o Gemma 4 rode até três vezes mais rápido, inclusive em celulares.

A solução encontrada foi combinar o modelo principal com modelos auxiliares menores, que trabalham em conjunto. Esses auxiliares fazem parte da técnica chamada Multi-Token Prediction (MTP), que antecipa partes da resposta que será gerada, enquanto o modelo principal valida essas previsões em paralelo durante o processamento.

Como Funciona a Combinação de Modelos

A combinação de modelos acontece na prática por meio de uma mudança na forma como o texto é gerado pelos modelos de linguagem. Em vez de produzir uma palavra por vez, o sistema desenvolvido pelo Google consegue antecipar múltiplos trechos de uma resposta de uma só vez. Isso é possível graças à técnica de decodificação especulativa, que acelera a geração de texto ao dividir o trabalho entre o modelo principal e seus auxiliares.

O modelo auxiliar antecipa partes da resposta, funcionando como um rascunho que sugere possíveis continuações para o texto. Enquanto isso, o modelo principal valida essas sugestões em paralelo antes de entregar a resposta final ao usuário. Se o modelo principal concordar com o rascunho, ele aceita toda a sequência em uma única passagem e ainda gera um token adicional nesse processo.

Benefícios da Combinação de Modelos

A combinação de modelos traz várias melhorias, incluindo:

  • Respostas mais rápidas em chats quase em tempo real, apps de voz e ferramentas com IA que executam tarefas automaticamente;
  • Possibilidade de rodar modelos avançados em PCs comuns e até offline, facilitando o desenvolvimento e o uso no dia a dia;
  • Melhor desempenho em celulares e outros dispositivos, com respostas mais ágeis e menor consumo de bateria;
  • Mesma qualidade nas respostas, já que o modelo principal continua revisando tudo antes de entregar o resultado.

Os modelos de rascunho com MTP do Gemma 4 já estão disponíveis sob a mesma licença Apache 2.0 do modelo principal e podem ser baixados em plataformas como Hugging Face, Kaggle e Ollama.

Este conteúdo pode conter links de compra.

Fonte: link