Duas conversas sobre agentes se cruzam aqui. Uma pergunta como melhorar o que acontece durante a execução; a outra, quanto trabalho podemos delegar sem perder a capacidade de avaliar o resultado. Os vídeos passam por pesquisa, produção de software e robótica.

Experimentar antes de ampliar a autonomia

Long-Horizon Agents Need Experiments, Not Just Prompts — Erina Karati · AI Engineer · 21min27s

Em tarefas longas, escrever mais instruções não mostra em que etapa o agente se desviou. O vídeo de Karati coloca os experimentos no centro da discussão: testar mudanças e observar a execução é mais útil do que procurar uma instrução perfeita.

Beating RL With Reflection: GEPA and Optimize Anything — Lakshya A. Agrawal · AI Engineer · 21min28s

Agrawal detalha o que se perde ao reduzir uma execução a uma recompensa numérica. GEPA usa os rastros, inclusive chamadas de ferramentas e erros, para propor revisões textuais nas instruções. A proposta interessa especialmente quando repetir milhares de tentativas ou treinar novamente o modelo custa caro; não dispensa medir se a revisão melhorou o resultado.

We Let Claude Code and Codex Race Human Researchers — Elie Bakouch · AI Engineer · 19min39s

A comparação anunciada entre agentes e pesquisadores humanos leva a pergunta para uma tarefa concreta. Sem resultados comparáveis aqui, ela não autoriza declarar um vencedor. Vale acompanhar como cada participante investiga, verifica e corrige suas hipóteses.

Delegar código, conferir a entrega

Software Engineering Is Becoming Factory Engineering — Zach Lloyd · AI Engineer · 20min37s

Lloyd apresenta a ideia de organizar o desenvolvimento como uma fábrica de software. A mudança de escala aumenta a importância de especificar o trabalho e verificar o código entregue: produzir uma alteração não é o mesmo que aceitá-la.

Get Out of the Model’s Way — Kevin Hou · AI Engineer · 19min01s

Na apresentação sobre Antigravity, Hou descreve a separação entre o ambiente de desenvolvimento e o gerenciador de agentes. Essa arquitetura permite coordenar tarefas fora da janela de edição. Também deixa mais visível uma decisão de produto: onde o agente pode agir sozinho e onde uma pessoa precisa revisar.

AI-Generated Code Is Already Competing With Human Code — Daksh Gupta · AI Engineer · 12min41s

O título propõe uma comparação forte com código humano. Sem método, amostra e critérios de avaliação expostos nesta edição, não dá para converter a provocação em uma taxa de sucesso. O ponto editorial é exigir a mesma revisão para código gerado e código escrito por pessoas.

Fora da tela, a avaliação fica mais difícil

Robot-Use Agents: Why General-Purpose Models May Win in Robotics · Y Combinator · 29min49s

O vídeo discute modelos de propósito geral no controle de robôs e a avaliação de sistemas físicos, incluindo o trabalho da Robocurve. Em robótica, uma demonstração isolada diz pouco sobre o comportamento em outros equipamentos e tarefas. A hipótese de que modelos gerais possam superar soluções especializadas ainda exige comparação em condições definidas.

Quanto mais trabalho delegamos aos agentes, mais precisamos entender como seus resultados foram testados.