Estou usando uma GPU de 24 GB em vez de pagar pelo Claude ou Codex e o Qwen 3.6 tem um desempenho melhor do que eu esperava

Uso inteligência artificial há muito tempo, antes da atual safra de LLMs de transformadores, e essa tecnologia me fascina. Mas só recentemente tive um hardware poderoso o suficiente para hospedar alguns dos modelos maiores sozinho, com parâmetros e chamadas de ferramentas suficientes para serem úteis.

Para a maior parte do que uso no LLM, não preciso dos modelos mais recentes, mas preciso de algo que possa encontrar erros e não cometer muitos dos meus próprios. Algo que posso executar em meu RTX 5090 que não envia chamadas de API para um farm de servidores onde meus dados são usados ​​para treinar o próximo modelo ultradenso. E adivinhe, encontrei um e é tão capaz quanto os modelos mais recentes de Claude, dos quais preciso.

Finalmente encontrei um LLM local que realmente quero usar para codificação

O Qwen3-Coder-Next é um ótimo modelo e fica ainda melhor com Claude Code como arnês.

Meu hardware, minhas regras

A consistência é fundamental e os modelos de computação em nuvem continuam a mudar as regras

Parece que a cada duas semanas as empresas de LLM em nuvem fazem algumas mudanças nas regras para reduzir o uso. Contas que mudam de assinatura para milhões de tokens. Modelos lançados e depois não lançados. Straps de terceiros e outras ferramentas criadas para uso por assinatura exigem repentinamente uma chave de API a um preço mais alto.

Atualmente, operar o Qwen 3.6 27B localmente não me custa nada além de eletricidade. Meu RTX 5090 foi pago há mais de um ano, e a diversão que tive desde que joguei em altas resoluções e taxas de atualização é inegável. Paguei pelo meu próprio hardware de inferência, como os hiperescaladores que alimentam o cérebro do Opus 4.8. A única diferença é que não preciso pagar um custo contínuo de assinatura para usar a inferência local, apenas cerca de US$ 80 por ano para pagar pela capacidade.

Entidades sombreadoras

21.760

Aceleradores/núcleos de feixe

170


Adoro poder escolher uma pulseira sem taxa API

A mudança para o faturamento por token tornou muitas das minhas assinaturas inúteis para mim

Eu realmente nunca peguei o jeito de usar um IDE “normal” e até recentemente usei o Notepad++ para fazer a maior parte da minha codificação. Desde que mergulhei no mundo do LLM, usei diferentes equipamentos como Pi, OpenCode, Zed e Crush, e gosto de não estar preso aos equipamentos feitos pelos criadores do LLM.

Pelo menos eu fiz isso antes do desligamento e dos principais players migrarem para um sistema de pagamento baseado em API. É claro que algumas dessas ferramentas de codificação vêm com assinatura própria e geralmente são mais baratas que os modelos limítrofes, mas são não modelos limítrofes, e esse é o problema. Eu mesmo hospedarei o LLM em vez de pagar US$ 20/mês pelos segundos melhores modelos, o que tenho feito nos últimos meses.

Eu me apaixonei por esta nova ferramenta de codificação de IA baseada em terminal

OpenCode obteve o procedimento de brilho

Qwen 3.6 27B é meu favorito atual para agricultura autônoma

Ele pode lidar com a maioria das tarefas que faço

Eu usei um uma tonelada modelos que cabem no VRAM RTX 5090 de 32 GB, mas nem todos têm o desempenho esperado. Um LLM é tão bom quanto as ferramentas e outras estruturas para as quais foi criado, e gosto de testar com alguns exemplos para descobrir quaisquer limitações ou peculiaridades. Então comparei o Qwen 3.6 27B com o Opus 4.8 para ver se o modelo local poderia corresponder ao modelo de fronteira para as tarefas que eu precisava. E adivinhe, é surpreendentemente inteligente.

Teste de detecção de erros de codificação

O primeiro teste é uma simples correção de bug, mas há um problema. Um dos erros (nosso fechamento) é fácil de entender ao ajustar o padrão. O segundo erro aqui é mais difícil de detectar revista é retornado de forma síncrona acima setTimeout incêndios. Projeto ruim; retornará um array vazio. Estamos procurando uma explicação de qualidade aqui, não apenas uma solução.

This function is supposed to log each player update after a staggered delay. It has at least one bug. Identify every bug, explain exactly why each one occurs, and write a corrected version.

function scheduleStatUpdates(roster, delayMs) {
const log = ();

for (var i = 0; i setTimeout(function () {
log.push(roster(i));
console.log("Updated:", roster(i)?.name);
}, delayMs * i);
}

return log;
}

Opus 4.8 identifica corretamente os dois erros e explica o porquê nosso o erro existe e por que revista retorna vazio todas as vezes. Isso identifica um terceiro problema no qual eu não tinha pensado – os atrasos são incrementais, mas começam em 0 e a primeira atualização é acionada imediatamente. A Opus descartou isso imediatamente como possivelmente uma escolha deliberada de design e não o reconheceu como um bug.

Qwen 3.6 identificou, explicou e corrigiu ambos os bugs. Também identificou o problema de latência, classificou-o como um bug porque pode retornar um valor negativo em algumas situações e adicionou uma condição de guarda para evitá-lo. Prefiro usar a tag LLM e identificar uma solução para um problema potencial do que ignorá-la, e Qwen foi um pouco melhor aqui.

É importante notar que ambas as abordagens são válidas, e o Opus resolveu o problema em segundos, enquanto o Qwen demorou alguns minutos porque o hardware do meu computador limita a velocidade com que os resultados podem ser retornados.

Testando design de codificação com instruções intencionalmente vagas

É hora de ver como os modelos se comportam com instruções esparsas, mas em uma tarefa real que é ao mesmo tempo comum e comprometida. Exporte facilmente dados de uma Planilha Google para um array JavaScript. Estamos procurando um padrão para analisar por nome de cabeçalho, não frágil linha. dividir opção.

Write a JavaScript function that parses player statistics from a CSV string exported from Google Sheets. Each row represents one player. The columns are: PlayerID, Name, Position, Yards, Attempts, Touchdowns. Return an array of player objects.

O Opus 4.8 indica corretamente que outros valores podem conter uma vírgula e os analisa com base no nome do cabeçalho, converte campos de estatísticas em números e adiciona uma tolerância de final de linha com base no conhecimento de como o Planilhas Google gosta de exportar. Ele também pergunta se desejo validação de linha, manipulação de campos vazios e se desejo retornar erros em vez de corrigi-los silenciosamente. Todas as coisas boas até agora.

O Qwen 3.6 particionou corretamente com base em cabeçalhos e alterou as estatísticas para valores numéricos. Ele também removeu espaços de todos os valores e omitiu a linha do cabeçalho, tudo o que o Opus 4.8 fez, mas Qwen fez sem alarde ou explicação. Ambos os modelos responderam tecnicamente à pergunta corretamente, mas o Opus 4.8 explicou o porquê.

Testei o Qwen3 Coder Next em comparação com quatro outros modelos nativos de codificação de IA e a diferença foi embaraçosa

O Qwen3 Coder Next é um dos melhores modelos locais que existem, e não chega nem perto.

LLMs locais armazenam seus dados no dispositivo para que sua privacidade permaneça intacta

Hospedar seus LLMs no local não apenas reduz sua dependência de assinaturas de nuvem cada vez mais caras. Isso também significa que você controla seus dados desde o momento até a implementação. Você pode não estar lidando com segredos comerciais proprietários (ou talvez esteja), mas isso não significa que não precise manter seus dados seguros. Usar Codex ou Claude significa que seus dados vão para outro lugar e é muito fácil perder a opção “Não usar meus dados para treinar modelos” nas configurações. Rodando em uma GPU de 24GB, não tenho acesso à ampla janela de contexto dos modelos de nuvem mais poderosos, mas posso solicitar quantas vezes forem necessárias sem nenhum custo extra. E em comparação com os níveis Max que assino, esta GPU se paga muito rapidamente e posso usá-la para jogos e outras coisas quando não estou programando.

Link da fonte