melhoria contínua

parte 03 de 03

“Terminou” não é “deu certo”.

A unidade de valor é o caso ligado ao seu resultado de negócio, não o registro de execução do agente. Cada correção vira um teste, cada incidente vira uma regra, e nada entra em produção se falhar nos casos do próprio agente.

§01   a medida

01 / 04

Medimos a carga inteira, não só os casos fáceis.

O denominador é a carga original, com falhas, escalações e reparos.

  • Conclusão verificadaUm registro correto no sistema, dias depois, sem reabrir. Não “o agente terminou”.
  • Minutos humanosPor caso da carga original, incluindo revisão e reparo.
  • Casos reabertosCasos aceitos que voltaram por correção ou contestação.
  • Falhas de alçadaContadas à parte. Uma grave nunca some numa média.
  • Custo por caso aceitoModelo, revisão e operação, por caso aceito, não por caso tentado.
  • Tempo ponta a pontaDa chegada ao registro aceito, por classe de caso.

Sem porcentagens fabricadas. Os números entram quando a linha de base de vocês existir, e o método de comparação fica escrito antes de o trabalho começar. Só para dar escala: os cenários econômicos do Anthropic Institute (Korinek, Jones, Sacher, Cotter e McCrory, WP 2026-02, setembro de 2026; opinião dos autores) ancoram em um ganho por tarefa de 35–57% vindo de testes de campo e empresas de fronteira, e registram que uma estimativa a partir de dados de conversas implica cerca de 5×. Nenhum dos dois é promessa sobre o fluxo de vocês.

§01.1

O denominador é a carga original. Sempre.

§02   o loop

02 / 04

Um loop liga operação e melhoria.

Uma correção do especialista vira caso de teste; quem libera é o dono; o resultado é medido nos próximos casos. Não é uma coleção de dashboards. É uma forma de decidir.

cena 08   o agente melhora

testes · portão · autonomia

Cena 8 · todo caso real é um teste. Uma mudança de prompt que falha em um nunca entra em produção; a que passa em todos entra, e o agente conquista mais espaço.owno.ai
  • 01   um caso é tratadoO agente roda o fluxo de trabalho; o registro do caso guarda cada evento, do recebimento até o resultado lido de volta.
  • 02   um especialista corrigeO especialista de vocês corrige o que estava errado, na ferramenta que já usa. A correção é um evento no caso, não um e-mail.
  • 03   a correção vira um testeO caso, com a resposta certa anexada, entra no conjunto de aceite. A suíte cresce com o histórico do agente, não com a imaginação de alguém.
  • 04   uma mudança é propostaUma edição de prompt, uma ferramenta nova, uma versão nova de modelo. Cada uma é um agente novo até que se prove o contrário.
  • 05   o portãoA mudança roda contra todos os casos reais. Falhou em um, não entra em produção. O caso que pegou a falha fica anexado.
  • 06   o dono assinaUm resultado que o compliance pode co-assinar substitui a reunião de revisão. Nada é liberado sem que alguém tenha escolhido.
  • 07   medido nos próximos casosOs seis números, por versão, na carga original. Melhor ou pior é um fato no placar, não uma opinião numa reunião.

i   testes a partir de casos reais

Nenhum benchmark sintético

Os casos vêm do registro: o que o agente de fato fez, o que o dono disse sobre isso, e o que veio disso. Cada incidente acrescenta um.

ii   um portão antes de toda mudança

Falha em um caso, não entra em produção

Prompt, ferramentas, modelo: toda mudança roda a suíte primeiro. A mudança que teria quebrado um caso real nunca chega à produção.

iii   autonomia que aumenta com evidência

Espaço se conquista, não se pressupõe

Quando o agente concorda com o dono por um período longo o bastante e seus testes seguem passando, owno propõe uma classe mais ampla que ele pode tratar sozinho. O dono assina. Os incidentes sobem, e o espaço volta a estreitar.

§03   o livro de regras

03 / 04

Regras não são escritas uma vez. Elas se acumulam, e cada uma é assinada.

Uma regra entra no livro por um de quatro caminhos. owno propõe a regra, a reexecuta sobre o tráfego real do mês passado para o dono ver exatamente o que ela teria recusado, e só a liga quando uma pessoa com nome assina.

fonte 1   os incidentes de vocês

O erro vira a regra

Um envio duplicado, um estorno revertido, uma exportação que ninguém aprovou. O incidente vira um teste escrito a partir das ações reais; o teste vira uma regra que o teria recusado. O mesmo erro não pode acontecer duas vezes.

fonte 2   as decisões do dono

Todo sim e todo não é um exemplo rotulado

A caixa de aprovações é um conjunto de treino. Duzentas respostas consistentes viram um limite: uma regra que deixa o agente agir sozinho naquela classe, ou uma que o segura. O dono assina a regra que ele já escreveu à mão.

fonte 3   outras frotas

Sugerida antes de o incidente ser de vocês

Padrões, nunca conteúdo: uma onda de injeção de prompt circulando esta semana, uma versão de modelo que piorou numa tarefa, uma definição de ferramenta que mudou por baixo de todo mundo. owno propõe a regra; vocês decidem se ela se aplica.

fonte 4   mudanças de modelo e de ferramenta

Uma versão nova é um agente novo

Uma atualização de modelo ou uma ferramenta alterada é reexecutada sobre os testes do próprio agente antes de uma única requisição em produção. O que passou fica; o que regrediu fica em espera, com o caso que pegou a regressão anexado.

O livro de regras crescendo, com três destas quatro fontes desenhadas, está na página inicial. O livro de regras cresce →

§03.1

Nada entra em vigor sem que alguém tenha escolhido.

§04   a prova

04 / 04

Ajudou ou não, isso é medido, não afirmado.

O método é declarado antes e o resultado é publicado por cliente, inclusive quando o resultado é nenhuma diferença.

cena 10   dois braços

aleatório · por ação · mesmo instrumento

Cena 10 · cada ação é atribuída ao acaso a um braço; os dois braços são registrados pelo mesmo instrumento. Os nulos contam.owno.ai

como

Aleatorizado por ação, não por agente nem por semana

Os dois braços enfrentam o mesmo tráfego. O braço sem bloqueio na ação é registrado pelo mesmo instrumento, e é isso que torna a diferença legível. Um resultado nulo é publicado com o mesmo peso de um ganho.

o segundo loop

O que aprendemos implantando vira pacote

Cada implantação deve deixar adaptadores, testes e um roteiro de operação que barateiam a próxima; o teste que impomos a nós mesmos é que a terceira implantação custe menos que a primeira. Padrões aprendidos numa frota chegam às outras como regras propostas, nunca como conteúdo.

Os quatro números que os braços comparam, custo por resultado correto, incidentes por mil ações, taxa de autonomia, liberações por agente por mês, estão na página inicial. Prova →

o primeiro passo

OWNO-WEB-1.2 · 2026-09-09

Comece por uma decisão que dá para inspecionar.

Um estudo de prontidão de duas a três semanas fixa a linha de base contra a qual os seis números serão medidos. Já tem agentes rodando? A recuperação começa por um mapa de falhas feito a partir dos casos deles.

owno.ai  ·  São Paulo