É difícil ignorar a controvérsia em torno da geração de imagens e vídeos; se os dados de treinamento foram extraídos sem consentimento, se os artistas estão sendo compensados ​​ou se os resultados fazem algo genuinamente novo ou simplesmente lavam o estilo de outra pessoa. O Adobe Firefly pareceu o menos desagradável porque é treinado em conteúdo licenciado do Adobe Stock e conteúdo de domínio público, mas ainda é pago além das linhas de crédito gratuitas. No outro extremo está o ChatGPT, que o Studio Ghibli teve um grande momento no ano passado, que prefiro não abordar aqui.

Não estou sugerindo que alguém precise de genAI – na maioria das vezes, realmente não acho que precisemos. Mas há casos raros em que é realmente útil, como esboçar uma maquete de design visual de espaço reservado antes que o ativo real exista ou esboçar um conceito de tatuagem antes de confirmar quando você não tem ideia de como desenhar. Portanto, não descartei toda a lacuna, apenas não encontrei uma ferramenta que me sentisse bem em usar. Então me deparei com o ComfyUI e foi um tipo de experiência completamente diferente.

Quer se manter atualizado sobre as últimas IA? O boletim informativo XDA AI Insider é publicado semanalmente com análises aprofundadas, recomendações de ferramentas e informações práticas que você não encontrará em nenhum outro lugar do site. Assine alterando sua newsletter.

6 dicas importantes do ComfyUI que todo iniciante deve saber

ComfyUI é tão vasto que é fácil perder algo simples

Confira o ComfyUI

Um playground auto-hospedado, de código aberto e baseado em nós

ComfyUI não é um tipo de ferramenta do tipo “digite um prompt e obtenha uma imagem”. É uma GUI baseada em nó para executar modelos de imagem de peso aberto, como Stable Diffusion e Flow, e a questão é que o pipeline de geração de imagem é construído conectando blocos na tela. Cada bloco faz um trabalho específico, como carregar o modelo, codificar o prompt, amostrar, decodificar, salvar… e você os conecta com linhas. Se você usou o modo de protótipo do Figma ou o editor de shader do Blender, a sensação é semelhante.

É de código aberto desenvolvido em Python e PyTorch e foi originalmente criado em janeiro de 2023 por um desenvolvedor chamado Comfyanonymous. Há toda a história de Stability AI sendo brevemente envolvida e, em seguida, convenientemente saindo em meados de 2024 para formar um grupo independente chamado Comfy Org com outros contribuidores importantes – o projeto tem sido conduzido pela comunidade desde então e agora é uma plataforma de lançamento para novos modelos de código aberto do Black Forest Labs (Flux) e até mesmo da própria Stability AI. Além de apenas gerar recursos visuais, configurar um nó significa que você pode criar fluxos de trabalho para coisas como pintura, zoom, passagens de animação e conectar vários modelos de maneiras que as ferramentas de prompt por si só não tocarão.

Você tem opções de configuração. O mais fácil é o instalador de desktop oficial de confortável.org/downloadque roda em Windows e Mac (Apple Silicon). No Linux, ou se você quiser apenas mais controle, clone o repositório e execute-o manualmente. Você deseja instalar PyTorch primeiro use a versão correta do CUDA, ROCm ou Metal para o seu hardware antes de executar o arquivo de requisitos, caso contrário pode não funcionar:

git clone https://github.com/Comfy-Org/ComfyUI
cd ComfyUI
pip install -r requirements.txt
python main.py

Você também vai querer usar um ponto de verificação de modelo – Fluxo rápido ou SDXL é um bom ponto de partida – de Hugging Face ou CivitAI e coloque-o em ComfyUI/models/checkpoints/. O resultado final é que ele precisa de GPU. 4 GB de VRAM é o mínimo para os modelos atuais, mas 8-12 GB é um mínimo realista para uma experiência tranquila.

Verifiquei todos os aplicativos gráficos gratuitos que encontrei e sempre volto a este

Ferramentas de design gratuitas pareciam limitadas até que experimentei esta

A interface é surpreendentemente acessível

E os modelos podem fazer a maior parte do trabalho pesado

A tela começa em branco e é bastante assustador no início, mas a barra lateral de modelos salva você. Existem mais de 350 fluxos de trabalho pré-construídos disponíveis e é aqui que recomendo que os iniciantes comecem a procurar. A barra lateral esquerda também contém ativos, nós, modelos e fluxos de trabalho salvos. Cada nó inclui parâmetros que você pode personalizar, menus suspensos para amostradores e campos de texto para prompts. Esta é a coisa mais próxima de abrir um editor de design de geração de imagens de IA como o Figma.

Os nós são onde fica divertido

Afinal, me preocupo mais em criar fluxo do que em saída

Nós é onde o ComfyUI ganha sua reputação. Um fluxo de imagem de texto básico pode ter sete deles: um ponto de verificação de carga (modelo), duas codificações de texto CLIP (um prompt positivo, um negativo), uma imagem latente vazia (define dimensões), KSampler (geração real), decodificação VAE (transforma-a em uma imagem visível) e Salvar imagem (arquivo de saída). Cada caixa tem entradas à esquerda e saídas à direita, e você desenha linhas entre elas para conectar o fluxo.

Acabei gastando tanto tempo puxando essas pequenas coisas que quase esqueci de executar o fluxo de trabalho em cada configuração! Há algo estranhamente satisfatório em acertar as caixas e observar os fios se conectando perfeitamente entre elas. KSampler é onde a maior parte da mágica acontece. As sementes controlam a aleatoriedade – a mesma semente e o mesmo prompt equivalem à mesma imagem, o que é enorme em termos de reprodutibilidade. As etapas determinam quantas passagens de eliminação de ruído ocorrem. CFG controla o quão estritamente o modelo obedece ao seu prompt. O amostrador e o agendador são os algoritmos reais que realizam a redução de ruído. Isso é o que Firefly e ChatGPT Image simplesmente não oferecem, você fica preso às configurações padrão.

A escolha do modelo também é importante. O Flux Schnell é rápido e fácil de licenciar, o Flux Dev oferece maior qualidade em velocidades mais baixas e o SDXL ainda é adequado para uso geral. Os modelos já conectam o modelo certo para tudo o que você está tentando fazer, então você não precisa pensar nisso nas primeiras execuções. Para ser sincero, o resultado que obtive nem foi o que me importou até o final, e fazer o fluxo acabou sendo a melhor parte.

Experimentei Claude Design, Replit e Figma Make para design de UI e um avançou quilômetros

O mesmo prompt, três ferramentas de codificação de vibração muito diferentes

Vale a pena dar uma passada mesmo se você for cético em relação à inteligência artificial

Não vou mentir, ainda não estou completamente convencido da geração de imagens de IA como categoria – a ética em torno disso é confusa e provavelmente será por um tempo. Mas o ComfyUI, com seu modelo de peso aberto, difere dos acessos pagos fechados e dos recursos questionáveis ​​dos dados de treinamento. Ele funciona no meu hardware e coloca a mecânica real de geração de imagens na minha frente, em vez de ocultá-las em uma caixa de prompt. Se, como eu, você está em dúvida sobre isso, talvez eu recomende dar uma chance a este.

Link da fonte