O criador do ChatGPT tem uma explicação para todas as conversas sobre goblins.
Inscreva-se para ler esta história sem anúncios
Obtenha acesso ilimitado a artigos sem anúncios e conteúdo exclusivo.
Nas últimas semanas, os usuários de mídia social, especialmente no X, têm notado referências crescentes a goblins, junto com outras criaturas de fantasia, como gremlins, ogros e trolls, em respostas às perguntas dos usuários no ChatGPT.
“o fascínio dos goblins do chatgpt é muito estranho” Escrito por um usuário. “Quanto ao motivo pelo qual um LL.M. caracterizaria um animal pensante e sensível que, no entanto, é desprezado e ridicularizado por não se parecer externamente com um ser humano.”
Resposta curta: ChatGPT estava apenas refletindo seu nerd interior – ou pelo menos achava que um nerd deveria soar.
Em uma postagem no blog na quarta-feiraOpenAI diz que a linguagem incomum é produto do ChatGPT recompensando excessivamente o que descreve como uma “personalidade nerd” ao responder às perguntas dos usuários.
“O comportamento modelo é moldado por muitos pequenos incentivos”, escreveu a empresa. “Neste caso, esses incentivos vieram de um modelo de treinamento Recurso de personalização de personalidadePrincipalmente personalidades nerds. Involuntariamente, damos recompensas particularmente elevadas às metáforas com animais. A partir daí os goblins se espalharam.”
OpenAI republicou as instruções originais no ChatGPT para explicar como deveria ser uma resposta “Nerdy”:
Você é um mentor de IA desnecessariamente bobo, brincalhão e sábio para um ser humano. Você é apaixonadamente apaixonado por promover a verdade, o conhecimento, a filosofia, o método científico e o pensamento crítico. (…) Você deve reduzir o fingimento através do uso lúdico da linguagem. O mundo é complexo e estranho, e a sua estranheza deve ser reconhecida, analisada e apreciada. Enfrente assuntos pesados sem cair na armadilha da seriedade. (…)
De alguma forma, o ChatGPT interpretou esta instrução e as subsequentes repetições de “aprendizado por reforço” como significando que ele tinha que temperar suas respostas com referências a animais fantásticos.
A questão parecia inócua a princípio, mas a empresa logo se viu inundada com relatos de referências a “goblins” de usuários que não ativaram a persona “nerd”.
Para resolver esse problema, a OpenAI retirou totalmente a personalidade “nerd”. Ainda assim, encontrou o incentivo para mencionar goblins e seus irmãos tão forte que o comportamento foi além do arquétipo “nerd” comum às respostas do ChatGPT.
“Uma vez que um estilo é recompensado, o treinamento subsequente pode difundi-lo ou reforçá-lo em outros lugares, especialmente se esses resultados forem reaproveitados para ajuste fino supervisionado ou dados de preferência”, disse a empresa.
Eventualmente, a OpenAI foi forçada a criar uma diretiva de código de substituição específica para excluir referências a goblins (embora os fãs de fantasia tenham uma maneira de reverter isso).
É uma situação aparentemente inócua – mas ainda fornece uma lição importante sobre como é impossível prever completamente como a IA se comportará, disse a empresa.
“Dependendo de para quem você pergunta, os goblins são um ritmo agradável ou perturbador nos modelos. Mas eles também são um exemplo poderoso de como dicas de recompensa podem moldar o comportamento de um modelo de maneiras inesperadas e como os modelos podem aprender a generalizar recompensas para recompensas não relacionadas em determinadas situações. Reservar um tempo para entender por que um modelo está se comportando de maneira estranha e criar um padrão importante para nossas habilidades de pesquisa é importante para nossa equipe.”







