Duas conversas sobre agentes se cruzam aqui. Uma pergunta como melhorar o que acontece durante a execução; a outra, quanto trabalho podemos delegar sem perder a capacidade de avaliar o resultado. Os vídeos passam por pesquisa, produção de software e robótica.
Experimentar antes de ampliar a autonomia
Long-Horizon Agents Need Experiments, Not Just Prompts — Erina Karati · AI Engineer · 21min27s
Em tarefas longas, escrever mais instruções não mostra em que etapa o agente se desviou. O vídeo de Karati coloca os experimentos no centro da discussão: testar mudanças e observar a execução é mais útil do que procurar uma instrução perfeita.
Beating RL With Reflection: GEPA and Optimize Anything — Lakshya A. Agrawal · AI Engineer · 21min28s
Agrawal detalha o que se perde ao reduzir uma execução a uma recompensa numérica. GEPA usa os rastros, inclusive chamadas de ferramentas e erros, para propor revisões textuais nas instruções. A proposta interessa especialmente quando repetir milhares de tentativas ou treinar novamente o modelo custa caro; não dispensa medir se a revisão melhorou o resultado.
We Let Claude Code and Codex Race Human Researchers — Elie Bakouch · AI Engineer · 19min39s
A comparação anunciada entre agentes e pesquisadores humanos leva a pergunta para uma tarefa concreta. Sem resultados comparáveis aqui, ela não autoriza declarar um vencedor. Vale acompanhar como cada participante investiga, verifica e corrige suas hipóteses.
Delegar código, conferir a entrega
Software Engineering Is Becoming Factory Engineering — Zach Lloyd · AI Engineer · 20min37s
Lloyd apresenta a ideia de organizar o desenvolvimento como uma fábrica de software. A mudança de escala aumenta a importância de especificar o trabalho e verificar o código entregue: produzir uma alteração não é o mesmo que aceitá-la.
Get Out of the Model’s Way — Kevin Hou · AI Engineer · 19min01s
Na apresentação sobre Antigravity, Hou descreve a separação entre o ambiente de desenvolvimento e o gerenciador de agentes. Essa arquitetura permite coordenar tarefas fora da janela de edição. Também deixa mais visível uma decisão de produto: onde o agente pode agir sozinho e onde uma pessoa precisa revisar.
AI-Generated Code Is Already Competing With Human Code — Daksh Gupta · AI Engineer · 12min41s
O título propõe uma comparação forte com código humano. Sem método, amostra e critérios de avaliação expostos nesta edição, não dá para converter a provocação em uma taxa de sucesso. O ponto editorial é exigir a mesma revisão para código gerado e código escrito por pessoas.
Fora da tela, a avaliação fica mais difícil
Robot-Use Agents: Why General-Purpose Models May Win in Robotics · Y Combinator · 29min49s
O vídeo discute modelos de propósito geral no controle de robôs e a avaliação de sistemas físicos, incluindo o trabalho da Robocurve. Em robótica, uma demonstração isolada diz pouco sobre o comportamento em outros equipamentos e tarefas. A hipótese de que modelos gerais possam superar soluções especializadas ainda exige comparação em condições definidas.
Quanto mais trabalho delegamos aos agentes, mais precisamos entender como seus resultados foram testados.