Uma semana com três lançamentos frontais quase simultâneos, da OpenAI, Anthropic e xAI, empurrou a competição para o terreno do preço. Enquanto isso, longe dos benchmarks, outros vídeos mostram a outra ponta: modelos treinados do zero em escala enxuta e agentes que precisam sair da tela para valer alguma coisa.

A guerra mudou para o preço

Matthew Berman destrincha os novos GPT-6 Sol and Luna, do canal Matthew Berman, em 7min26s. A leitura é direta: a OpenAI abriu mão de competir só no topo da tabela e passou a atacar pelo custo. O Luna sai a 10 centavos por milhão de tokens de entrada e, segundo o vídeo, chega a 66,6% no Frontier Code por 22 centavos por tarefa. É o perfil de modelo que muda a conta de qualquer automação rotineira. A separação entre a linha frontier (Astra, Opus 5.5) e a linha de trabalho (Sol, Luna) tende a virar a nova normalidade do mercado: o modelo caro para o raciocínio difícil, o barato para todo o resto.

Enquanto isso, no mundo físico

Armen Aghajanyan, da Perceptron AI, defende em From VLM/VLA’s to Embodied Agents, do canal AI Engineer, em 20min42s, que visão, linguagem e ação precisam de um modelo único, com fusão precoce das modalidades, em vez de sistemas isolados costurados por fora. O obstáculo que ele aponta é honesto: uma hora de vídeo gera milhões de tokens visuais e não existe ground truth confiável para supervisionar isso. Transcrição e rotulagem sintética são paliativos, não solução. Cody Menefee, da Firecrawl, leva o argumento para o chão, ou melhor, para o pasto: em You’re Not Thinking Big Enough: Rebuilding Food Systems with AI Agents, do canal AI Engineer, em 18min26s, ele parte da própria experiência com criação de animais para argumentar que desenvolvedores estão mirando baixo demais, e que a rotação de pastagens é exatamente o tipo de problema sujo e concreto onde agentes com dados reais fazem diferença. Os dois vídeos conversam: um desenha o modelo que percebe e age, o outro mostra o problema no qual ele precisaria agir.

Do zero, com 3 bilhões de parâmetros

Há espaço para propostas fora do eixo preço versus escala. Em From Scratch to SOTA: Training a 3B State-Space Vision Model, do canal AI Engineer, em 21min09s, Krishna Prasad Srinivasan, da Sarvam, apresenta o treinamento de um modelo de visão com arquitetura state-space do zero, com 3 bilhões de parâmetros, até resultados competitivos. O detalhe está no próprio título: treinar do zero em vez de partir de um modelo pronto, em escala enxuta. É o mesmo espírito dos preços agressivos da OpenAI, visto do outro lado: derrubar o custo de entrada amplia quem consegue construir.

O preço dos tokens cai, os modelos ganham corpo e o treino do zero volta a fazer sentido fora do Vale. A pergunta que sobra é qual dessas frentes chega primeiro na vida de quem programa todo dia.