A IA nativa fez uma grande pergunta: do que o seu hardware é realmente capaz? A resposta determinava quais modelos você poderia executar, a extensão do contexto que poderia promover e se a visão ou o áudio eram relevantes. Ainda é uma dúvida, mas não é mais tão preto e branco, pois continuam aparecendo modelos menores que não se importam tanto com suas especificações.
A variante menor do Gemma 4 é uma delas. Ele roda com 3 GB de memória GPU, lida com texto, imagens e áudio e funciona perfeitamente com hardware que a maioria das pessoas já possui…
Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando suas preferências de boletim informativo!
O Google criou um modelo que funciona em quase todos os lugares
E a pequena pegada vem da arquitetura, não do comprometimento do poder do cérebro
O Gemma 4 E2B é a menor variante da família Google Gemma 4, e o “E” significa eficiente, já que o modelo é tecnicamente maior que o 2B do nome. Cerca de 5 bilhões de parâmetros no nível do arquivo, mas roda em um modelo de memória de 2B. O Google faz isso com algo chamado incorporação em camadas, onde alguns dos parâmetros são executados na CPU em vez da GPU, de modo que a GPU só precisa lidar com o peso principal.
Eu realmente não entendo a profundidade desta questão – matemática, cálculos, hardware e assim por diante não são meu domínio, mas o efeito é bastante simples se você for um usuário. Você está basicamente trabalhando com um modelo que deveria ser mais pesado do que é, mas é leve.
Também é nativamente multimodal, portanto, texto, imagens e áudio estão disponíveis imediatamente. Isso inclui análise de documentos e PDF, compreensão da tela e da interface do usuário, trabalho gráfico e OCR e muito mais. Metade dos modelos maiores que usei não fazem essa combinação e certamente não nesse tamanho. O contexto chega a 128 mil tokens, o que é realmente muito para algo tão pequeno. A chamada de função também está integrada. Há muita coisa envolvida nessa pequena coisa.
Por que estou usando um modelo 2B em um computador que pode fazer mais
De longe o mais fácil de alcançar
8 GB de VRAM é o limite para IA nativa, mas é basicamente um luxo para E2B. Posso operar confortavelmente até 12B com esta placa, então optar pelo menor modelo da família pode parecer uma jogada estranha no papel, mas a razão pela qual continuo voltando a ela é que a altura extra me permite fazer mais. Posso mover o contexto para cima e ainda ter a visão e o áudio funcionando, deixar o navegador aberto com vinte abas e o editor de design funcionando. Com um modelo maior, eu teria que me comprometer em algum lugar.
A configuração padrão do meu executor coloca o uso da GPU E2B em cerca de 4,7 GB, o que é mais de 3 GB, mas ainda perfeitamente adequado na minha placa. Para chegar ao número de 3 GB, você precisa eliminar o contexto, descarregar parcialmente algumas camadas para a CPU e possivelmente quantizar o cache KV. Eu fiz isso e obtive uma GPU de 2,87 GB. O desempenho é negativo porque as camadas da CPU são mais lentas que as camadas da GPU, mas ainda parece responsivo e posso executar muitas outras coisas ao mesmo tempo.
Meu caso de uso favorito é exibir capturas de tela da IU e perguntar o que funciona e o que não funciona. Ter um segundo olhar sobre um layout que você está observando há muito tempo é sempre útil, e o E2B é muito bom em detectar problemas e inconsistências de fluxo do usuário. Mas não se trata apenas de capturas de tela; Gemma também lê e entende os objetos da foto.
Para documentos, eu uso principalmente PDFs financeiros e médicos, que é melhor não carregar no modelo de nuvem. O máximo que alimentei foi cerca de 20 páginas e contando. Pelo que eu posso dizer, ele ainda não teve alucinações (além dos estranhos quebra-cabeças que eu joguei nele), embora eu ache que a maior parte disso está no corredor fazendo o trabalho pesado com a forma como ele é dividido e recuperado dos documentos, não o modelo em si.
O caso extremo é um caso em questão
Foi para isso que foi construído
Telefones e Chromebooks não têm VRAM como os PCs para jogos. O modelo roda em uma única memória que é compartilhada com todo o resto, então o limite é diferente, mas o princípio é o mesmo, você precisa de um modelo pequeno o suficiente para não atrapalhar todo o resto. Meu iPhone 16 lida perfeitamente com E2B, e a visão e o áudio também funcionam bem (meu corredor preferido não tem áudio, apenas conversão de texto em fala).
Eu até executei no meu Chromebook, o que basicamente só é bom para tarefas leves de navegação e anotações. É o dispositivo com menos potência que possuo e você definitivamente pode sentir a diferença; o número de tokens por segundo é bastante baixo. Mas a questão é que estou usando IA nativa para poder usá-la quando não houver internet.
Isso é o que me interessa no E2B – o mesmo modelo cobre todos os dispositivos que possuo e a experiência aumenta, não diminui. Um PC tem muito espaço, um telefone tem conveniência, um Chromebook tem a prova de que a arquitetura significa o que diz.
Pequeno, mas poderoso
Meu primeiro modelo Gemma 4 foi o E4B, é um pouco mais poderoso quando se trata de tarefas de raciocínio e sessões mais longas e me dá respostas mais coerentes e estruturadas. Mas o E2B não é de forma alguma descartável e não deve ser subestimado. O Google chegou ao limite e funcionou exatamente como planejado para esse caso de uso, mas continuarei a executá-lo no meu PC também, pois me dá um modelo capaz com espaço livre para continuar outras tarefas sem levar o PC ao seu limite.







