Claude é geralmente considerado a melhor ferramenta de codificação de agentes do mercado atualmente. Muitos desenvolvedores que conheço usam isso todos os dias, e a Anthropic passou o último ano e meio fornecendo muitas razões para essa crença. Com o Opus 4.7 lançado no mês passado, o Claude Code continua sendo uma das ferramentas de agente mais populares do mercado (apesar de prevalência de alternativas), e padrões como Sonetos e até mesmo Haiku ainda são padrões válidos para diversas tarefas.

No entanto, as condições de acesso em torno de Claude mudaram no último ano em uma direção e não no que os assinantes desejam. As restrições semanais foram anunciadas além das janelas de cinco horas existentes em julho de 2025. As regras do consumidor foram alteradas no outono para que, para usuários Gratuitos, Pro e Max, as conversas sejam padrão para treinamento, economizando de trinta dias a cinco anos para quem não optar por sair, tudo por causa de uma mudança de interface de usuário padrão que a maioria das pessoas não viu antes de 8 de outubro. As cotas nos horários de pico foram tacitamente aumentadas, O cache imediato TTL de Claude Code foi aparentemente cortadoe pulseiras de terceiros foram bloqueadas no faturamento de assinaturas. Cada mudança tem um motivo justificável, mas juntas elas descrevem um relacionamento que realmente parece hostil para os desenvolvedores.

Tudo o que isso me provou é que seu relacionamento com o modelo de nuvem pode mudar a qualquer momento, e a parte do pool de IA que você realmente possui é aquela em que você pode confiar. Claude não é ruim, nem estou dizendo que todos deveriam comprar um RTX 4090 para começar a executar localmente um modelo de 27 bilhões de parâmetros. O relacionamento com a nuvem é um problema em si, e os modelos locais tornaram-se bons o suficiente para serem considerados alternativas significativas para grande parte do trabalho diário.

Os usuários da nuvem viram muitas mudanças

E todos eles vão na mesma direção

A maneira como a Anthropic abordou esse problema não foi a estratégia usual de “ferver o sapo” que frequentemente vemos em produtos SaaS. A empresa evoluiu rapidamente ao anunciar abertamente muitas mudanças, embora algumas delas tenham gerado semanas de “Claude está ficando nervoso?” cobertura antes que a Antrópica reconhecesse a causa. O código de Claude é onde você vê isso mais claramente: a Anthropic mudou o esforço de raciocínio padrão de alto para médio em 4 de março, introduziu um bug de limpeza de pensamento de sessão ociosa em 26 de março, reverteu a mudança no esforço de raciocínio em 7 de abril, adicionou um prompt do sistema de redução de verbosidade em 16 de abril que prejudicou a qualidade de codificação de abril e restaurou20. uma pilha de configurações do lado do servidor que os usuários não podiam ver e não podiam cancelar. Dario Amodei disse que a Anthropic planejou um crescimento dez vezes maior e conseguiu oitenta vezes, o que explica até certo ponto o aperto.

Fora do próprio arnês, a pressão assumiu uma forma diferente. Em março de 2026, a Anthropic ajustou os limites de sessão de cinco horas durante os horários de pico dos dias de semana para permitir que os usuários os utilizassem mais rapidamente, mas os limites semanais permaneceram inalterados. Um abalo de energia da SpaceX em 6 de maio evitou reduções nos horários de pico. Os termos de serviço mudaram, depois mudaram novamente, e a mudança só aconteceu quando a capacidade aumentou. No código de Claude, a Anthropic reduziu o TTL do cache imediato de uma hora para cinco minutos sem aviso prévio, e a diferença só ficou aparente depois que os usuários criaram seus logs de sessão por data. A Anthropic respondeu dizendo que cinco minutos sempre foi o padrão e que o cache de uma hora era um experimento tecnicamente defensável e retoricamente conveniente ao mesmo tempo. Parece que foi cancelado para alguns usuários, mas essa é a pior parte: a comunicação mais consistente da Anthropic vem de sua equipe no X, e não de anúncios oficiais.

Isso também não é tudo. Em 9 de janeiro de 2026, a Anthropic implantou silenciosamente verificações no lado do servidor que bloquearam as credenciais Free, Pro e Max OAuth de funcionar em qualquer instalação de terceiros, e OpenCode, Cursor, Cline, RooCode e outros foram encerrados durante a noite, sem aviso prévio. Engenheiros xAI foram bloqueados de Claude via Cursor sob a Regra Comercial D.4. seção. A Anthropic formalizou a política em uma atualização dos Termos de Serviço por volta de 17 de fevereiro, adicionando uma nova seção chamada “Autenticação e uso de credenciais”. A camada de descoberta que a Anthropic construiu para implementá-lo produziu o incidente de cobrança HERMES.md dois meses depois: o código de Claude insere o status git em seu prompt do sistema, e o padrão da camada de detecção de instalação corresponde ao conteúdo, portanto, um arquivo HERMES.md em qualquer lugar do seu histórico foi suficiente para mudar você para o preço pré-pago. Um usuário do Max postou um excedente de US$ 200,98 além de seu plano de US$ 200, mas 86% de sua assinatura permanece intacta, com o engenheiro Tarik Shihipar admitindo “um bug na detecção de instalação de terceiros e como extraímos o status do git no prompt do sistema”.

Por fim, a partir de 15 de junho, devido a alterações anunciadas recentemente, o uso de claude -p e do Agent SDK será cobrado como uso programático. Os usuários do Claude Pro, Max x5 e Max x20 podem reivindicar um crédito mensal de US$ 20, US$ 100 e US$ 200, respectivamente, para esses fluxos de trabalho, mas este é outro exemplo de como a Anthropic tira parte do controle sobre o que os usuários finais podem fazer com o Claude Code.

O que torna tudo ainda mais difícil de entender é como a empresa criou tanta boa vontade pública até aquele momento. Em julho de 2025, a Anthropic recebeu um contrato de US$ 200 milhões com o Pentágono que fez de Claude o primeiro modelo de fronteira aprovado em redes classificadas. Quando o DoD posteriormente solicitou acesso para “todos os fins legais”, a Antrópico recusou-se a renunciar às suas proibições de vigilância doméstica em massa e de sistemas de armas totalmente autónomos. Em 27 de fevereiro, o secretário de Defesa Pete Hegseth declarou a empresa um “risco da cadeia de abastecimento” e ordenou que as agências federais parassem de usar a IA da Anthropic. É uma postura de princípios e que rendeu à Antrópica muita cobertura positiva sobre ética. Mas apenas cinco dias depois, em 4 de março, a mesma empresa rebaixou discretamente o esforço de raciocínio padrão de Claude Code de alto para médio e não contou a ninguém durante semanas.

Para ser justo, a Anthropic mudou um pouco isso em maio, depois de fechar um acordo com a SpaceX, assinar todos os cálculos do Colossus I, mais de 300 megawatts e mais de 220.000 GPUs NVIDIA, e diretamente vinculado aos limites mais altos de Claude. O anúncio de 13 de maio aumentou os limites semanais do Claude Code em 50% até 13 de julho, aparentemente devido à pressão competitiva do impulso do OpenAI Codex. No entanto, isso não altera a direção geral. Seu acesso depende da computação da Anthropic, da pressão comercial da Anthropic por parte da OpenAI e xAI e da visão de justiça da Anthropic em toda sua base de usuários, nenhuma das quais você pode influenciar.

Os modelos locais têm crescido durante todo esse tempo

Eles não são piores que nuvens

Durante o mesmo período em que a Anthropic parecia estar aumentando seus usuários, as opções de modelos abertos cresceram significativamente. Gemma 4 foi lançado em 2 de abril de 2026 com uma licença Apache 2.0 devidamente permissiva, quatro tamanhos (E2B, E4B, 31B e 26B A4B), contexto de 256K e uma variante 26B A4B rodando em hardware de consumidor em velocidades verdadeiramente impressionantes. O Qwen 3.6-27B do Alibaba chegou no mesmo mês como um burro de carga denso que cabe em uma GPU de 24 GB de consumidor único com quantização. O Qwen 3.6-35B-A3B, o irmão mais novo do MoE com apenas 3B de parâmetros ativos por marcador, também é fantástico em sua classe de tamanho.

Por exemplo, em um teste controlado de engenharia reversa que executei o Qwen 3.6-27B em um 7900 XTX, ele extraiu cerca de 37 tokens por segundo de geração para Q4_K_M com cerca de 90.000 tokens em um contexto utilizável. Como o alvo tinha duas vulnerabilidades, ele encontrou ambas, expôs duas vulnerabilidades adicionais e venceu o GPT-5.4 nesta execução específica, que errou os valores do oráculo do tempo e da alucinação. Não estou dizendo que é melhor de forma alguma do que GPT-5.4, mas tal resultado era impensável há apenas um ano.

ZAYA1-8B de Zyphraentretanto, é o modelo local mais interessante que já vi. É um modelo Mixture of Experts com 8 bilhões de parâmetros totais e 700 milhões de ativos, licenciado como Apache 2.0 e totalmente treinado em AMD MI300X sem Nvidia. As comparações publicadas de Zyphra com GPT-5-High dependem fortemente do RSA Markoviano e do tempo de teste, em vez da execução local regular de ordem única, então eu não leria o ZAYA1-8B como evidência de que modelos pequenos superam sistemas marginais. Eu interpretaria isso como uma evidência de que a arquitetura, a eficiência dos parâmetros ativos e a estimativa do tempo de teste estão tornando os modelos nativos mais interessantes mais cedo do que a maioria das pessoas esperava.

Nem tudo é ideal para modelos locais e, portanto, a nuvem ainda tem o seu lugar. O hardware para executar qualquer coisa a partir de 27B custa um pouco, e tanto a VRAM quanto a RAM do sistema são restrições constantes que são ainda mais difíceis de igualar, dados os aumentos de custo de ambos no ano passado. Também requer mais configuração do que usar um modelo somente em nuvem, o planejamento de longo prazo é mais fraco e a confiabilidade de longo prazo pode ser difícil. Os nativos não superam Claude de primeira classe, seja por raciocínio forte, planejamento longo de várias etapas ou amplo conhecimento mundial. No entanto, com capacidades de pesquisa e outras formas de obter dados em tempo real fora da sua base de conhecimento, os modelos locais são uma possibilidade real de alcançar, em vez da novidade amadora que já foram.

Os vendedores podem desligar a tomada a qualquer momento

Mas o seu modelo local é o seu modelo local

Antrópico pode para afrouxar as restrições, e a mudança de maio provou isso. Mas também poderão apertar novamente assim que os preços do Codex se estabilizarem e a capacidade da SpaceX for absorvida, e o vencimento semanal em 13 de julho dirá tudo sobre o quão resiliente é a situação atual. Não é que alguma destas decisões esteja errada nos seus próprios termos, é que todas elas têm de ser tomadas e você tem de responder. A qualidade do modelo, os preços, o esforço de raciocínio, o comportamento do cache, os padrões de treinamento, as cotas e a disponibilidade são todos controlados pelo lado do servidor, e o ano passado mostrou quantas dessas discagens um provedor de nuvem pode girar em qualquer direção.

O modelo local que você baixou não pode ser retirado ou restringido nos horários de pico, nem pode ser selecionado para treinamento. Nem pode reduzir silenciosamente o esforço de raciocínio de alto para médio porque não existe um orçamento calculado. Depois de obter a balança e hospedá-la você mesmo, as condições de acesso serão fixas enquanto o modelo estiver em execução. O comportamento da Antrópico no último ano e meio, incluindo as partes sobre as quais eles foram transparentes e as partes que mudaram, torna esse contraste difícil de ignorar.

Claude ainda será a melhor ferramenta para esse tipo de coisa, e se você é viciado no Opus 4.7, não estou dizendo que você deve cancelar sua assinatura e mudar para o modelo nativo. Direi que, mais do que nunca, é um serviço em primeiro lugar, com limites, políticas de cache, configurações de argumentos, regras de retenção e disponibilidade, tudo em uma escala que a Antrópica pode atingir. Enquanto isso, os modelos locais podem lidar com muitas tarefas diárias que antes só podiam ser realizadas pela nuvem. A disparidade tem vindo a diminuir de forma constante e, enquanto estes avanços continuarem, é pouco provável que mude.

Link da fonte