O código não guarda a decisão
Modelos melhores permitem simplificar instruções e etapas de trabalho. Isso não torna dispensáveis as decisões, verificações e formas de isolamento que o código não registra.
Modelos melhores permitem simplificar instruções e etapas de trabalho. Isso não torna dispensáveis as decisões, verificações e formas de isolamento que o código não registra.
Jev, da TypeSafe, propõe uma camada de decisão tipada para software. A ideia arquitetural é boa; os números de lançamento pedem leitura cuidadosa.
Quando a IA começa a acelerar a própria pesquisa, segurança deixa de ser apenas uma propriedade do modelo e passa a ser uma propriedade do processo que constrói o próximo modelo.
A OpenAI diz ter encontrado uma prova para a versão forçada de Navier–Stokes com 10 mil agentes. O resultado é importante, mas a matemática ainda precisa de revisão independente e a história envolve uma disputa séria sobre dados, prioridade e autoria.
A OpenAI lançou o GPT-6 Astra e não economizou no superlativo: seria a AGI. Os números fortes dependem da interface de execução; os independentes mostram um modelo soberbo em algumas frentes e apenas competitivo em outras.
Cloudflare declarou o SDLC obsoleto e propôs delegar o ciclo inteiro a agentes. O diagnóstico está certo. Só que um paper de maio mostra que agentes perdem 30 pontos de pass rate conforme restrições estruturais se acumulam — e restrição acumulada é a definição de codebase corporativo.
Agentes cruzaram o Rubicão do "dá pra fazer". Mas a parte cara da engenharia nunca foi escrever o código — e a pergunta que ninguém responde é de onde virá a próxima geração capaz de fazer o resto.
Um talk da Unblocked diagnostica certo: o gargalo dos agentes migrou da inteligência para o contexto. Mas contexto não é um andar, são quatro — intra-sessão, memória, organizacional e verificação — e o quarto não chega ao produto. O que muda para quem constrói.
Cinco dias de comunidade em torno do novo modelo aberto da Alibaba: excelente nos benchmarks, absurdo no padrão de raciocínio, e um debate que separa quem supervisiona o agente de quem delega e vai dormir.
Um worm auto-replicante comprometeu keyv, cacheable e dezenas de pacotes npm com 2 bilhões de downloads mensais. O ataque publica código assinado com provenance legítima do GitHub Actions, rouba credenciais de CI, e planta persistência em .claude e .vscode. O que muda na forma como você deveria confiar em supply chain.
Um sistema de paper trading com agentes LLM que reportava 77% de acerto. Após corrigir quatro modos de falha de medição, o número real é 51,5% — uma moeda. O diagnóstico do que cada erro escondeu, e o que generaliza para deployment de AI em ambiente corporativo.
Apple aguarda o estouro, lobby recorde em Washington, livros raros destruídos para treino de modelos. O ceticismo informado como antídoto.
O estado da arte migrou de "simular reuniões entre LLMs" para execução radical. Mas o gargalo real é a economia do erro, não a inteligência.