Notícias
20 notícias
Agente promete persistência, mas segurança e qualidade seguem em prova
O prime-agent reúne execução persistente, subagentes, memória durável, refinamento com rollback e retomada após desconexão, mas exige isolamento externo, revisão humana e benchmark contra Codex e Claude Code.
Agentes aceleram falhas quando a disciplina fica para trás
Biblioteca MIT reúne skills componíveis para alinhamento, pesquisa, especificação, TDD, debugging, arquitetura, revisão e triagem em agentes; a Saraiva.AI recomenda testar, mas alerta para sobreposição, drift e ausência…
Agentes aceleram o código — o pyscn tenta frear o estrago
Analisador estrutural para bases Python detecta código morto, clones Type 1–4, complexidade, hotspots, violações arquiteturais e acoplamento/coesão; gera nota 0–100 com relatório HTML e se conecta a Claude…
Agentes de código em paralelo saem do caos de terminais isolados
Orca é um cockpit open source para operar vários agentes de desenvolvimento em worktrees Git isoladas, com acompanhamento de estados, revisão de diffs, integração GitHub e controle por…
Agentes de código perdem o mapa — e um grafo tenta devolvê-lo
code-review-graph usa Tree-sitter para construir e atualizar de forma incremental um mapa estrutural do repositório e expõe contexto seletivo a Codex, Claude Code e outros agentes via MCP/CLI;…
Agentes de código pulam qualidade — pacote tenta frear o atalho
Pacote MIT com 24 skills de engenharia cobre DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP, com comandos de ciclo, personas, checklists e quality gates;…
Agentes longos acertam a tarefa errada e fecham mal a sessão
A coleção MIT khazix-skills estrutura padrões leader e neat-freak para Claude Code, Codex e outros agentes; a Saraiva.AI avalia Goal Contract e Closeout Contract como pré e pós-flight,…
Agentes travam em tarefas longas, e este harness entra em teste
O LongHorizon-Harness propõe separar planejamento, execução e auditoria para manter objetivos e progresso verificado em tarefas de desktop e CLI; a Saraiva.AI decidiu testá-lo, mas aponta limites de…
Configurações sensíveis elevam o teste do cc-switch a alerta
O gerenciador desktop centraliza configurações, provedores, modelos, skills e múltiplos agentes ou CLIs, mas ainda precisa provar segurança na gestão de credenciais, proxy local e sincronização.
book-to-skill: o que muda na prática — e o que ainda precisa ser provado
Conhecimento importante fica preso em PDFs, documentação, runbooks e métodos e precisa ser relido/reexplicado a cada sessão. O projeto paga o custo de estruturação uma vez e entrega…
Código vira memória, mas segurança e maturidade seguem em teste
O codebase-memory-mcp indexa repositórios em um grafo persistente e local para clientes MCP, como Codex e Claude Code; a Saraiva.AI recomenda testar agora, com auditoria do instalador, proteção…
DeepSeek-Reasonix entra no radar, mas economia ainda não está provada
Runtime local open source para programação promete reduzir custo e instabilidade em tarefas longas com sessões cache-aware, checkpoints e permissões, mas depende do modelo escolhido, amplia riscos com…