Por que os modelos melhoram: o que muda entre as versões
O que realmente melhora em modelos mais novos — conhecimento, raciocínio, confiabilidade, capacidade — e por que o «IA não consegue fazer isso» do ano passado já está desatualizado.
No verão de 2023, os modelos tinham uma tarefa favorita em que tropeçavam: «quantas letras «r» tem na palavra «rabanete»». Respondiam com confiança e incorretamente. Perguntavam quanto é 17 × 24 — recebiam um número bonito, mas errado. Pediam para citar um artigo — recebiam um título plausível de um trabalho inexistente.
Hoje, os mesmos problemas são resolvidos por um modelo comum sem hesitação. Não porque alguém inseriu as respostas em uma tabela, mas porque várias gerações mudaram em três anos. Vamos analisar o que exatamente muda de versão para versão — esta é a única maneira de não fazer planos com base em limitações antigas.
O que realmente melhora
«O modelo ficou mais inteligente» — isso não significa nada. As melhorias seguem quatro linhas distintas, e elas não estão conectadas entre si: o modelo pode calcular muito bem e, ao mesmo tempo, ainda inventar referências.
- Conhecimento. Dados de treinamento mais recentes e mais amplos. Aqui, o progresso é o mais chato: a questão é apenas o que foi colocado na amostra de treinamento.
- Raciocínio. A capacidade de manter vários passos seguidos sem perder o fio. Aqui ocorreu o principal salto: os modelos foram ensinados a «pensar» primeiro para si mesmos e depois a responder. Antes, a resposta era disparada imediatamente — como um aluno que começa a falar sem ouvir a pergunta até o fim.
- Confiabilidade. Com que frequência o modelo mente com confiança. Tornou-se visivelmente menos frequente, e o principal surgiu — ele admite mais vezes que não sabe algo, em vez de inventar algo plausível. Mas o problema não está resolvido: referências e detalhes inventados ainda aparecem, e ainda é preciso verificar.
- Volume e sentidos. A janela de contexto cresceu de 128 mil tokens para um milhão, foram adicionadas imagens, áudio, vídeo. A lição anterior foi sobre a janela.
Por que eles melhoram, afinal
Três alavancas, e todas as três continuam funcionando.
- Mais computação para treinamento. Cada próxima geração é treinada por mais tempo e com mais placas de vídeo. O caminho mais direto: os mesmos princípios, mais recursos.
- Dados melhores, não apenas mais. Modelos antigos eram treinados em toda a internet. Agora, a amostra é limpa, o lixo é removido e exemplos de bons raciocínios escritos especificamente são adicionados. Você se lembra da lição sobre dados — lá está a resposta de por que isso é mais importante que o volume.
- Treinamento com avaliações humanas. As pessoas mostram pares de respostas, elas marcam a melhor, o modelo se ajusta. Assim, ele aprende não a «continuar o texto», mas a ser útil: responder ao que interessa, admitir o desconhecimento, não ser rude.
Como isso se parece em uma tarefa
Vamos pegar uma tarefa onde a diferença é visível a olho nu:
Eu tinha 8 anos quando minha irmã tinha a metade da minha idade. Agora tenho 30. Quantos anos tem minha irmã?
A armadilha está nas palavras «a metade da idade». Quem responde pela primeira impressão divide a idade atual pela metade e diz 15. Foi exatamente assim que os modelos antigos responderam — e, para ser honesto, metade das pessoas também responde assim.
O raciocínio correto é outro. Quando eu tinha 8, minha irmã tinha 4 — o que significa que ela é 4 anos mais nova, e essa diferença nunca muda. Tenho 30, então minha irmã tem 26.
A diferença entre 15 e 26 não é «um pouco mais preciso». São respostas diferentes: uma incorreta, outra correta. E ela é obtida exatamente porque o modelo primeiro analisa a condição passo a passo, em vez de pegar o primeiro número que parece adequado.
O que isso significa para você
Três conclusões que valem mais do que qualquer lista de versões.
- Sua experiência envelhece mais rápido do que parece. «Eu tentei, a IA não consegue fazer isso» — uma frase com prazo de validade expirando. Se você tentou há um ano, isso não diz nada sobre hoje.
- Não se prenda a um único modelo. O líder muda a cada poucos meses. Uma habilidade útil não é «conhecer o ChatGPT», mas saber como definir a tarefa para que qualquer ferramenta a entenda.
- Ainda é preciso verificar. Os modelos se tornaram mais confiáveis, mas não infalíveis. Quanto mais importante a decisão, mais rigorosa a verificação — essa regra não envelheceu em nenhuma geração.
Faça agora: tente desativar o raciocínio
Não construiremos uma máquina do tempo, mas você pode tentar proibir o modelo de fazer o que foi ensinado nos últimos três anos — pensar antes de responder. Execute duas consultas seguidas e compare.
Primeiro — uma tentativa de restaurar o estilo dos modelos antigos: resposta imediata, sem etapas.
Responda instantaneamente, em uma única linha, apenas o número final. Sem raciocínio, sem etapas intermediárias, sem verificação: A assinatura custa 300 rublos por mês. A partir do quarto mês, o preço aumentou 10%, a partir do oitavo — caiu 20% do último preço. Quanto foi pago no total por 9 meses?
Segundo — como eles respondem agora: a mesma tarefa, mas com análise.
Resolva passo a passo, mostrando cada etapa e os totais intermediários. No final, verifique a resposta somando tudo novamente: A assinatura custa 300 rublos por mês. A partir do quarto mês, o preço aumentou 10%, a partir do oitavo — caiu 20% do último preço. Quanto foi pago no total por 9 meses?
A resposta correta é 2748 rublos: três meses a 300, quatro a 330, dois a 264.
O que você provavelmente verá
Nós executamos essas consultas antes de escrever a lição, e o resultado foi mais interessante do que o planejado.
- O modelo frequentemente não obedece ao primeiro prompt. Pedem a ele uma única linha sem raciocínio — e ele ainda começa a calcular em voz alta. O hábito de pensar antes de responder foi tão profundamente enraizado que ele contorna a proibição direta.
- Quando obedece — erra. Nesta tarefa, a resposta rápida se desvia: é fácil perder que o desconto é calculado sobre o preço já aumentado, e não sobre os 300 iniciais.
- O segundo prompt não dá apenas a resposta, mas também a cadeia. E isso é o principal: o número pode ser verificado. A resposta rápida precisa ser aceita pela fé.
A propósito, sobre as clássicas tarefas-armadilha — «taco e bola», «lírios no lago». Nós também as verificamos: o modelo de hoje as resolve corretamente mesmo sem etapas, porque as viu no treinamento milhares de vezes. As armadilhas em que a IA tropeçava há três anos pararam de funcionar — é exatamente sobre isso que trata toda a lição.
Conclusão prática: «resolva passo a passo» — não é um pedido educado, mas um interruptor. Ele ativa o mecanismo pelo qual várias gerações de modelos mudaram, e transforma a resposta de «acredite em mim» em «verifique-me».
Short questions on the lesson — with an explanation for every answer.