A discussão mudou de lugar. Os vídeos desta rodada raramente comem um peso de modelo novo; eles olham para o que está ao redor dele. O código que envolve a chamada, o contexto que o agente consegue manter, as fontes que ele alcança. E, para equilibrar, uma sátira lembra que o espetáculo de lançamentos continua o mesmo.

O harness importa mais que o modelo

Why The Harness Matters More Than The Model | YC Paper Club, Y Combinator · 1h00min11s

A provocação do painel é objetiva: os mesmos pesos que pontuam 30% no ARC-AGI chegam a 95% com um harness melhor. Scaffolding virou palavra feita no meio, e o vídeo dedica uma hora a desfazer isso. Passa por harnesses que se melhoram sozinhos, contexto tratado como hierarquia de cache em níveis e uma leitura histórica que compara a transição ao salto da máquina de Turing para a arquitetura de von Neumann.

O encontro também traz três construções concretas. O Prime Agent, um harness autorreciclável para modelos de raciocínio. O OpenJarvis, IA pessoal rodando no próprio dispositivo, com a promessa de custar 800 vezes menos que o equivalente na nuvem. E o QM, o agente interno da YC, aberto no repositório: uma frota de 50 agentes que escolhe o próprio sandbox, define orçamento por objetivo e esbarra justamente onde menos se espera, no contexto social que um funcionário entende por instinto.

A mesma tese aparece em menor escala no vídeo sobre acesso a fontes externas.

How to give your agent access to Reddit, X, and Papers · 10min39s

Aqui o agente é competente, mas cego. Sem acesso a Reddit, X e papers acadêmicos, ele emite parecer sobre uma decisão técnica sem as fontes onde a discussão acontece primeiro. A demonstração usa um middleware que conecta o agente a essas APIs e mostra o antes e o depois: sites com proteção anti-bot bloqueiam a coleta direta, e o dado em tempo real muda a qualidade da resposta. O middleware não substitui o agente; apenas devolve a ele o mundo exterior.

Contexto e execução como memória de trabalho

I’ve had early access to Astra… it’s INSANE, Matthew Berman · 13min31s

A demonstração do Astra constrói jogos e simulações no navegador a partir de instruções simples: um clone de Fall Guys, uma cidade em ASCII, um SimCity jogável. O mais revelador é a reação ao retorno do usuário, com o modelo ajustando a taxa de quadros para melhorar a execução. A geração de código vira um ciclo de teste e correção, não uma entrega única. O limite também aparece: gerar ativos individuais levou cinco dias contínuos. O protótipo acelera; a execução em escala, não.

Why AI Agents Need Million-Token Context, Thomas Wolf e Olive Song, MiniMax · 20min48s

A conversa sobre o M3 recusa o contexto longo como número de tabela comparativa e o trata como memória de trabalho. Um agente que interage com ferramentas em várias rodadas precisa manter documentos, resultados intermediários e decisões ao alcance enquanto a tarefa continua. A arquitetura MSA, de atenção esparsa, é o caminho descrito para sustentar 1 milhão de tokens, e a publicação aberta do método permite discutir implementação, não só demo.

Quando o lançamento vira roteiro

Did OpenAI actually build AGI? GPT-6 Astra first look, Fireship · 7min27s

O Fireship imagina uma semana fictícia de lançamentos: modelos novos, preços em queda, promessas extraordinárias e serviços caindo na pior hora. A piada funciona porque o roteiro é reconhecível. E ela encosta numa questão real, a de um modelo barato treinado com dados dos usuários, trocando preço por privacidade. A corrida deixou de ser só por capacidade; agora é por distribuição, custo e controle dos dados. Chamar tudo de AGI não resolve a conta, só aumenta o volume.

A pergunta útil deixou de ser qual modelo responder melhor, e passou a ser qual sistema aguenta trabalhar mais tempo sem transformar contexto, custo e privacidade em surpresa.