1. Agentes de longa duração exigem experimentação, não ajustes de prompt — Erina Karati · Prime Intellect
- O que aconteceu: Novos trabalhos avaliam agentes que mantêm estado por longos períodos e comparam Claude Code e Codex com pesquisadores em tarefas automatizadas de pesquisa.
- Por que importa: A qualidade desses sistemas passa a depender de experimentos reproduzíveis e avaliações contínuas, não apenas da engenharia de prompts.
- No radar: Memória, evolução de estado e desempenho ao longo do tempo precisam entrar explicitamente nos protocolos de avaliação.
2. Feedback textual vira mecanismo de otimização — GEPA · GLM-5.3-Flash
- O que aconteceu: GEPA explora otimização reflexiva de prompts, agentes e modelos, enquanto outro trabalho transforma o GLM-5.3-Flash em um modelo de decisões tipadas com probabilidades em uma única passagem.
- Por que importa: As duas abordagens apontam para melhorias orientadas por feedback e saídas estruturadas sem depender exclusivamente de atualizações de pesos.
- No radar: O caso do GLM afirma alcançar precisão e velocidade comparáveis às do Jev; a robustez fora da tarefa apresentada será o teste decisivo.
3. China considera liberar novos chips Nvidia para gigantes locais — The Information
- O que aconteceu: O governo chinês sinalizou que poderá permitir compras do RTX Pro 5500 por empresas como Alibaba e ByteDance.
- Por que importa: A possível autorização aliviaria parte da pressão por capacidade computacional para operar chatbots e agentes no país.
- No radar: O pedido governamental para que empresas informem seus planos de compra indica que o acesso poderá ser seletivo e supervisionado.
4. Isolamento de agentes chega ao desenvolvimento para plataformas Apple — Augur
- O que aconteceu: O Augur executa agentes de programação em máquinas virtuais macOS com Xcode ou em contêineres Linux, expondo somente o diretório atual e limitando a rede por lista autorizada.
- Por que importa: O projeto leva controles de isolamento ao ciclo completo de compilação e testes para aplicações Apple, reduzindo o alcance do agente sobre a máquina hospedeira.
- No radar: Ambientes descartáveis e políticas explícitas de arquivos e rede tendem a se tornar requisitos básicos para agentes com acesso a ferramentas.
Síntese: A fronteira está migrando de agentes apenas capazes para agentes mensuráveis, otimizáveis e isolados. Ao mesmo tempo, acesso a computação e decisões estruturadas em modelos rápidos consolidam a infraestrutura como parte central dessa disputa.
Repositórios e projetos da comunidade
- Provenance Gate — gateway determinístico de chamadas de ferramentas apresentado como alternativa a classificadores de injeção de prompt.
- ProofForge — projeto de agentes cujas provas precisam compilar em Lean.
- Simple GPU Job Scheduler — agendador simples de tarefas para GPU.
- Leftovers — ferramenta para localizar processos deixados em execução por agentes de programação no macOS.
- swe-mux — multiplexador de terminal para agentes de programação, otimizado para uso móvel.