O custo de uma decisão de IA pode cair por dois caminhos: tornar os modelos mais eficientes ou evitar que eles produzam texto quando basta uma resposta estruturada. Mas há outra conta nessa história. Quando milhares de agentes trabalham ao mesmo tempo, a comunicação entre eles também pesa. Quatro vídeos mostram esses limites por ângulos diferentes.
Dez mil agentes, um problema
No episódio do Dwarkesh Patel, Noam Brown relata um experimento com 10 mil agentes, 130 bilhões de tokens e 88 horas de execução para avançar sobre um problema de Prêmio Milenar. O resultado não equivale a uma solução definitiva; mostra o que acontece quando vários caminhos de raciocínio podem ser explorados em paralelo. Brown compara o esforço a cerca de 4.000 anos de raciocínio sequencial, uma estimativa que depende da equivalência adotada, não uma medida literal de trabalho humano.
O ganho de tempo vem acompanhado de uma pergunta econômica: quanto custa coordenar esse esforço, além de pagar pelos tokens? Segundo Brown, o experimento saiu mais barato do que ele esperava. É uma observação sobre aquele caso, não uma garantia de que qualquer enxame escale da mesma forma.
OpenAI researcher on agent swarms & recursive self-improvement · Dwarkesh Patel · 1h20min
O preço de cada resposta
Matthew Berman apresenta o Opus 5.5 como um modelo mais rápido e 40% mais barato que seu antecessor. Ele relata ganhos em testes de programação e trabalho de conhecimento, incluindo mais de 300 pontos Elo no GDP Val. Também descreve o modelo como menor e destilado, mas a relação entre tamanho, método de treinamento e desempenho merece cautela enquanto depender do relato sobre o lançamento. O contraste interessa: capacidade de ponta não precisa significar o maior custo por resposta.
Anthropic went CRAZY (Opus 5.5) · Matthew Berman · 32min00s
O vídeo do Fireship leva a redução de custo para outra direção. O Jev, da TypeSafe AI, recebe perguntas tipadas e devolve uma escolha, uma pontuação ou um valor nulo, em vez de uma explicação em texto livre. Seus criadores anunciam custo 440 vezes menor e velocidade 200 vezes maior que os modelos grandes, além de ausência de alucinações. São promessas, não resultados independentes: o próprio Fireship questiona os testes apresentados, e a arquitetura não foi divulgada. Uma reprodução de código aberto usa as probabilidades de um Qwen-4B congelado em uma única passagem, mas isso não demonstra que seja o funcionamento do Jev.
An ex-OpenAI researcher just deleted language from the LLM… · Fireship · 5min27s
A conta que chega à rede
Se o trabalho de muitos agentes se tornar comum, a rede do centro de dados terá de lidar com trocas curtas e frequentes sem deixá-las presas atrás de transferências grandes. John Ousterhout argumenta que TCP e RDMA não tratam bem essa combinação e apresenta o Homa, protocolo que prioriza mensagens curtas. Na palestra, ele mostra medições de redução expressiva da latência de cauda. Isso não significa aposentar o TCP em toda a internet: o argumento se refere às cargas de centros de dados que ele estudou.
Homa: The End of TCP for AI Clusters · AI Engineer · 18min48s
Modelos mais baratos ampliam o que vale a pena perguntar; milhares de perguntas em paralelo tornam a rede parte da resposta.