i testes a partir de casos reais
Nenhum benchmark sintético
Os casos vêm do registro: o que o agente de fato fez, o que o dono disse sobre isso, e o que veio disso. Cada incidente acrescenta um.
melhoria contínua
parte 03 de 03
A unidade de valor é o caso ligado ao seu resultado de negócio, não o registro de execução do agente. Cada correção vira um teste, cada incidente vira uma regra, e nada entra em produção se falhar nos casos do próprio agente.
§01 a medida
01 / 04
O denominador é a carga original, com falhas, escalações e reparos.
Sem porcentagens fabricadas. Os números entram quando a linha de base de vocês existir, e o método de comparação fica escrito antes de o trabalho começar. Só para dar escala: os cenários econômicos do Anthropic Institute (Korinek, Jones, Sacher, Cotter e McCrory, WP 2026-02, setembro de 2026; opinião dos autores) ancoram em um ganho por tarefa de 35–57% vindo de testes de campo e empresas de fronteira, e registram que uma estimativa a partir de dados de conversas implica cerca de 5×. Nenhum dos dois é promessa sobre o fluxo de vocês.
§01.1
O denominador é a carga original. Sempre.
§02 o loop
02 / 04
Uma correção do especialista vira caso de teste; quem libera é o dono; o resultado é medido nos próximos casos. Não é uma coleção de dashboards. É uma forma de decidir.
cena 08 o agente melhora
testes · portão · autonomia
i testes a partir de casos reais
Os casos vêm do registro: o que o agente de fato fez, o que o dono disse sobre isso, e o que veio disso. Cada incidente acrescenta um.
ii um portão antes de toda mudança
Prompt, ferramentas, modelo: toda mudança roda a suíte primeiro. A mudança que teria quebrado um caso real nunca chega à produção.
iii autonomia que aumenta com evidência
Quando o agente concorda com o dono por um período longo o bastante e seus testes seguem passando, owno propõe uma classe mais ampla que ele pode tratar sozinho. O dono assina. Os incidentes sobem, e o espaço volta a estreitar.
§03 o livro de regras
03 / 04
Uma regra entra no livro por um de quatro caminhos. owno propõe a regra, a reexecuta sobre o tráfego real do mês passado para o dono ver exatamente o que ela teria recusado, e só a liga quando uma pessoa com nome assina.
fonte 1 os incidentes de vocês
Um envio duplicado, um estorno revertido, uma exportação que ninguém aprovou. O incidente vira um teste escrito a partir das ações reais; o teste vira uma regra que o teria recusado. O mesmo erro não pode acontecer duas vezes.
fonte 2 as decisões do dono
A caixa de aprovações é um conjunto de treino. Duzentas respostas consistentes viram um limite: uma regra que deixa o agente agir sozinho naquela classe, ou uma que o segura. O dono assina a regra que ele já escreveu à mão.
fonte 3 outras frotas
Padrões, nunca conteúdo: uma onda de injeção de prompt circulando esta semana, uma versão de modelo que piorou numa tarefa, uma definição de ferramenta que mudou por baixo de todo mundo. owno propõe a regra; vocês decidem se ela se aplica.
fonte 4 mudanças de modelo e de ferramenta
Uma atualização de modelo ou uma ferramenta alterada é reexecutada sobre os testes do próprio agente antes de uma única requisição em produção. O que passou fica; o que regrediu fica em espera, com o caso que pegou a regressão anexado.
O livro de regras crescendo, com três destas quatro fontes desenhadas, está na página inicial. O livro de regras cresce →
§03.1
Nada entra em vigor sem que alguém tenha escolhido.
§04 a prova
04 / 04
O método é declarado antes e o resultado é publicado por cliente, inclusive quando o resultado é nenhuma diferença.
cena 10 dois braços
aleatório · por ação · mesmo instrumento
como
Os dois braços enfrentam o mesmo tráfego. O braço sem bloqueio na ação é registrado pelo mesmo instrumento, e é isso que torna a diferença legível. Um resultado nulo é publicado com o mesmo peso de um ganho.
o segundo loop
Cada implantação deve deixar adaptadores, testes e um roteiro de operação que barateiam a próxima; o teste que impomos a nós mesmos é que a terceira implantação custe menos que a primeira. Padrões aprendidos numa frota chegam às outras como regras propostas, nunca como conteúdo.
Os quatro números que os braços comparam, custo por resultado correto, incidentes por mil ações, taxa de autonomia, liberações por agente por mês, estão na página inicial. Prova →
o primeiro passo
OWNO-WEB-1.2 · 2026-09-09
Um estudo de prontidão de duas a três semanas fixa a linha de base contra a qual os seis números serão medidos. Já tem agentes rodando? A recuperação começa por um mapa de falhas feito a partir dos casos deles.
owno.ai · São Paulo