Um modelo faz um oceano em 3D e um jogo no navegador. Outro vídeo pergunta o que sobra do trabalho de programar quando agentes escrevem o código. Entre a demonstração e a aplicação útil, alguém ainda precisa definir o problema e conferir o resultado.
Do prompt para a experiência
Sonnet 5.5 Is Here. Look What It Can Build. · Matthew Berman · 17min
O vídeo mostra o Sonnet 5.5 criando uma simulação de oceano em 3D no navegador, com ondas, clima e iluminação variáveis, além de um jogo jogável inspirado em Fall Guys. O ponto mais interessante não é apenas o resultado visual. É a quantidade de estrutura que o modelo consegue montar a partir de poucos comandos, desde que alguém peça que ele verifique o próprio trabalho.
Esse detalhe muda bastante a leitura da demonstração. Gerar a primeira versão é só o começo. O modelo precisa receber instruções para testar, encontrar o que quebrou e corrigir a experiência. A autonomia aparece menos na ausência de intervenção humana do que na capacidade de continuar trabalhando depois do primeiro resultado.
Escrever código ou responder pelo sistema?
DHH has gone completely off the rails… · Fireship · 6min44s
O Fireship comenta uma palestra de David Heinemeier Hansson sobre programação com agentes. O vídeo provoca: se agentes fazem boa parte das alterações, qual é o valor de digitar código à mão? A resposta do apresentador é menos apocalíptica do que o título sugere. Formular o problema, desenhar o sistema e avaliar o que foi produzido continuam sendo trabalho de engenharia. Ele usa humor e exagero para discutir as teses de DHH; a enquete informal citada no vídeo não mede o futuro da profissão.
O modelo como produto
OpenAI COOKED · Matthew Berman · 10min
O vídeo passa por anúncios ligados ao Dots, pelo modo ultrarrápido, pelo plano Pro 500, pelos limites de uso e por atualizações do Codex. Também mostra tópicos como revisão de código, controle por voz, a Decisions API, plugins e o ChatGPT Space. Mesmo sem uma demonstração longa de um único projeto, a lista deixa clara a direção: o modelo está sendo cercado por interfaces, ferramentas e formas diferentes de executar tarefas.
O oceano mostra o que o modelo consegue construir; o vídeo do Fireship põe em dúvida a antiga divisão entre quem escreve e quem revisa código. Os anúncios apresentados por Berman tentam transformar essa capacidade em produto, com acesso mais rápido e ferramentas de desenvolvimento. O teste para quem usa continua prático: conseguir terminar o trabalho e verificar o que foi feito.
Uma demonstração bem-sucedida não prova que o resultado será confiável em tarefas abertas. O exemplo do oceano depende de pedir verificação, e uma experiência visual convincente pode esconder erros no código. A revisão continua fazendo parte do processo.
O próximo teste não é o que o modelo consegue criar em um vídeo, mas o que ele consegue manter funcionando depois que a câmera desliga.