No entanto, durante muito tempo, a IA multimodal teve um modelo onde todas as coisas impressionantes geralmente acontecem na nuvem. Suas capturas de tela, mensagens de voz e documentos devem ser enviados a um servidor de terceiros, processados por um modelo de outra pessoa e retornados com uma resposta. O impacto na privacidade foi apenas o preço da conveniência que você ofereceu. Tudo isso é justo se você está apenas procurando algumas notas aleatórias que deseja entender, mas para qualquer pessoa que lida com propriedade intelectual, informações de saúde e dados de identificação pessoal, a IA na nuvem apresentava um risco pelo qual eles não tinham apetite.
Estes últimos são especialmente um grupo de pessoas que recomendo A família de modelos Gemma aos modelos abertos do Google podem fazer quase tudo que você esperaria de um LLM. Eles podem ver imagens, entender fala, analisar e digitalizar documentos e, talvez o mais impressionante, eles vêm em uma variedade de tamanhos, o que significa que podem ser usados quase independentemente do dispositivo que você possui. É por isso que o Gemma 4 é meu “pau para toda obra” pessoal.
O Gemma 4 pode ser o único modelo local de que você precisa
Para a maioria dos usuários, ele faz tudo, e faz tudo bem
O Google fez grandes avanços em IA nos últimos anos. Do NotebookLM, depois o primeiro modelo Gemini, depois o Google Opal, seguido pelo Gemini Omni. Com base nesses marcos, parece que a família Gemma está pegando o DNA central de cada inovação e empacotando-o para execução local, o que o torna o desenvolvimento do Google mais interessante em meus livros.
Quando digo que o Gemma 4 é excelente na maioria das tarefas que você realiza, estou me referindo principalmente às suas capacidades de visão, que são dolorosas de não fazer. qualquer modelo de linguagem hoje. Quando digo que faz a maioria das tarefas OK É claro que estou falando de suas capacidades e também dos recursos que exige do usuário. Normalmente, um modelo equipado com recursos de visão precisa ocupar memória em sua VRAM enquanto adiciona latência a cada imagem que você solta em um bate-papo, pois precisa de um codificador de visão para “ver” o que você está compartilhando. Na verdade, o Gemma 4 não precisa dessa sobrecarga, e a razão para isso é uma decisão arquitetônica inteligente.
As imagens podem fluir diretamente para o backbone do modelo usando uma camada de incorporação leve que economiza a carga de memória de outros modelos equivalentes. A falta dessa sobrecarga me permite rodar o modelo no meu Lenovo Legion 5, que está equipado com um RTX 3070 móvel com 8 GB de VRAM, o que, como você deve ter adivinhado, deixa pouco espaço para respirar. qualquer acima da cabeça. No meu uso, eu alimento capturas de tela de páginas de BIOS, dados de benchmark, gráficos de desempenho e deixo o modelo buscar os números como tabelas limpas que posso alimentar em outro modelo para exportar como planilhas do Excel. Mas é claro, com o fator de privacidade adicional de todos os dados armazenados em seu computador, você pode adicionar tudo o que não quiser em um servidor em nuvem.
É um modelo local ouvir você
E não quero dizer apenas metaforicamente
Cada um tem sua maneira preferida de usar um modelo de linguagem diretamente relacionado ao seu fluxo de trabalho. Às vezes são PDFs, às vezes são planilhas e às vezes são horas de conversas gravadas que ninguém quer reproduzir do começo ao fim. Podem ser reuniões, entrevistas, palestras universitárias e memorandos de voz, que muitas vezes contêm mais informações do que lembramos, mas transcrevê-los manualmente em algo pesquisável e indexável é onde o fluxo de trabalho muitas vezes chega a um beco sem saída.
É esse problema que agora pode ser resolvido pelos recursos de áudio do Gemma 4. Em vez de tratar o reconhecimento de fala como uma atividade separada que obriga você a mudar para outro modelo ou pagar uma quantia por um serviço de transcrição online, ele pode ouvir diretamente as gravações e raciocinar sobre o que ouve. Você pode solicitar que ele colete informações, lembre-se de itens acionáveis, identifique temas importantes ou recorrentes ou responda a perguntas sobre uma gravação sem primeiro traduzi-la em texto.
Embora eu tenha descoberto esse recurso apenas recentemente, ele me levou a chamá-lo de “canivete suíço” dos modelos. Claro, eu poderia facilmente ter usado um modelo de nuvem para resolver esse problema, mas isso teria exposto os briefings gravados aos servidores de nuvem de outra pessoa e possivelmente cairia na área cinzenta da violação das políticas de conformidade de dados, então não é realmente uma opção para qualquer pessoa em setores altamente regulamentados. Mesmo que você ignore as obrigações legais, ainda encontrará usuários que simplesmente não querem permitir que seus dados privados sejam usados para treinar outros modelos. Nesse aspecto, Gemma oferece comodidade gratuitamente.
Quanto aos modelos Gemma 4, atualmente apenas os modelos E2B e E4B oferecem reconhecimento automático de fala nativo.
Sua memória muda a maneira como eu trabalho
Uma janela de contexto de 256K torna a IA nativa muito prática
A variante Gemma 4 12B tem uma janela de contexto de 256K, o que significa que posso alimentá-la com todas as obras de William Shakespeare, anotações de reuniões de um ano e até mesmo um pequeno repositório de código e esperar respostas com base em tudo isso. É difícil acreditar que, não muito tempo atrás, os modelos nativos compatíveis com laptops ainda estavam presos em malabarismos com janelas de 8K e esqueceram sua primeira pergunta com a terceira.
Também aqui meu Legion 5 tem sido parte integrante do meu fluxo de trabalho por pelo menos seis anos após seu lançamento e cinco anos após a compra. O modelo de 7,6 GB não é muito pesado para a VRAM de 8 GB do RTX 3070. Em uso, fica claro que Google dimensiona este modelo para laptopse o requisito se aplica independentemente da sua carga de trabalho. As tarefas de leitura que costumo realizar no modelo são basicamente apenas resumo e descoberta de padrões, especialmente quando se trata de dados ou manuais que não me incomodo em ler linha por linha. Todas essas tarefas parecem se adequar às capacidades do modelo e são úteis quando estou preso em um aeroporto sem acesso à Internet ou em um táxi a caminho de lá.
O Gemma 4 12B foi projetado para a experiência do laptop
Há uma estranha sensação de poder em ser capaz de embalar em sua mochila ou mala um modelo poderoso de grande linguagem que respeite sua privacidade e faça o que você pede (em várias introduções). Talvez seja isso que o Google estava tentando alcançar com seus modelos Gemma. É fácil de operar, não exige que você fique preso a um Wi-Fi instável ou a um ponto de acesso pessoal e ajuda você a navegar em seu fluxo de trabalho mesmo em trânsito. É realmente um Steam Deck de ótimos modelos de linguagem e não consigo dizer melhor.






