Modelos melhores ajudam, mas não resolvem sozinhos os problemas de um sistema de IA. Os vídeos desta edição chegam ao mesmo ponto por caminhos diferentes: é preciso decidir o que fica no prompt, o que vai para a memória, como os dados são consultados e de que forma as pessoas acompanham o sistema em produção.

Memória não é ajuste fino

Stop Fine-Tuning to Fix Retrieval Problems, Anant Srivastava, 20min12s

A tese de Anant Srivastava é direta: ajuste fino não deve ser o primeiro remédio para um problema de recuperação. A memória externa, como um sistema RAG, continua adequada para fatos que mudam. Os pesos do modelo fazem mais sentido quando o formato da resposta já está estável e o sistema precisa incorporar um comportamento ou conhecimento procedural.

O vídeo também descreve uma evolução possível. Interações começam como sinais no prompt, viram memórias duráveis e, quando humanos convergem sobre o resultado desejado, podem alimentar um ajuste fino. A fronteira entre memória e pesos deixa de ser uma escolha permanente e passa a acompanhar a maturidade do sistema. O ponto mais útil aqui é econômico: um modelo menor, ajustado para uma tarefa específica, pode reduzir a dependência de chamadas caras, mas só depois que a tarefa estiver bem definida.

A interface também faz parte da arquitetura

Dashboards Are Dead, Sarah Simionescu, Composio, 10min42s

Sarah Simionescu critica os painéis tradicionais por obrigarem o usuário a traduzir uma pergunta em linguagens diferentes, como consultas do Datadog, JQL ou buscas no Slack. A promessa de uma interface conversacional é eliminar essa tradução: a pessoa pergunta o que quer saber e o agente consulta as fontes necessárias.

A ressalva é importante. Um modelo pode ajudar em consultas simples, mas perde precisão quando precisa combinar dados de várias fontes. O MCP padroniza a comunicação entre o agente e essas fontes, mas não resolve sozinho a falta de memória das interações nem o custo de contexto demais. Dar mais ferramentas ao agente pode deixá-lo menos útil, não mais.

Velocidade sem dados suficientes

What Makes Open Models Fast in Production, Sujee Maniyam, Nebius, 20min32s

Este vídeo entra na lista com uma ressalva: a transcrição disponível registra apenas os comentários finais da palestra. Não há material suficiente para afirmar quais técnicas foram apresentadas, e as referências a quantização, otimização de núcleos ou compilação permanecem possibilidades, não conclusões do vídeo.

Mesmo com essa lacuna, o título conversa com os outros dois. Desempenho em produção não depende apenas do modelo escolhido. Recuperação, memória, ferramentas e interface também determinam quanto custa e quão rápido um sistema responde. Sem a palestra completa, qualquer explicação técnica seria especulação, então fica apenas a pergunta que o vídeo deixa aberta: onde está o gargalo real do sistema?

Modelos são importantes, mas a arquitetura ao redor deles costuma decidir se a ideia funciona fora da demonstração.