Seu agente detecta 73% de erros? (validação em escala)
Sakana AI: Peer review automático detecta 73% de erros. Seu agente? Como validar qualidade em escala. MLR system.
Equipe OpenClaw · Time de Engenharia & Produto
A Equipe OpenClaw é formada por engenheiros, designers e especialistas em IA dedicados a construir a melhor plataforma de agentes conversacionais para negócios brasileiros. Combinamos expertise…
Seu agente detecta 73% de erros? (validação em escala)
Notícia: Sakana AI publicou research em peer review automático (LLM-assisted). Sistema deles: detecta 73% de core-claim errors em papers. Não é só "copiar review humano" (como outros fazem). É detectar erros plantados deliberadamente. Implicação: Se Sakana consegue detectar 73% de erros com peer review automático, seu agente PODE estar validando outputs com mesma precision.
Problema: Seu agente gera conteúdo/análise/decisões. Você NUNCA valida em escala. Sakana mostrou que é POSSÍVEL. Pergunta: **Por que você não tá fazendo?
**"Você é CEO de SaaS com agente gerando conteúdo.
Cenário: Agente sem validação ├─ Agente gera: 100 respostas/dia ├─ Qualidade: Unknown (nunca validou) ├─ Erros: 5-15% (estimado, você não sabe) ├─ Consequência: Usuários recebem content fake ├─ Trust: Quebrado (gradualmente) ├─ Churn: Aumenta (users percebem qualidade ruim) └─ Revenue: Diminui (churn = lost MRR)
Cenário: Agente com validação (Sakana-style) ├─ Agente gera: 100 respostas/dia ├─ Sistema valida: 73% dos erros detectados ├─ Erros passando: 1-4% (muito melhor) ├─ Qualidade: Validada, confiável ├─ Trust: Mantém (users confiam) ├─ Churn: Baixo (quality é good) └─ Revenue: Cresce (retention ↑)
Diferença: 73% error detection = +50% quality perception "**
Como Sakana detecta 73% de erros (e por que importa)
O problema com peer review tradicional
PEER REVIEW HUMANO (académico):
Process: ├─ Author escreve paper ├─ Envia pra conference/journal ├─ Editor designa reviewers (3-5 humans) ├─ Reviewers leem (8-20 horas cada) ├─ Escrevem review (2-5 horas cada) ├─ Total: 40-150 horas humanas por paper ├─ Tempo: 3-6 meses └─ Custo: ~R$ 20K por paper (estimado)
Problema: ├─ Lento (6 meses pra resultado) ├─ Caro (R$ 20K) ├─ Não escala (não tem reviewers suficientes) ├─ Subjetivo (reviewer A acha bom, B acha ruim) └─ Incompleto (reviewer pode miss erros)
Aplicação em SaaS: ├─ Você teria que revisar cada agente output? ├─ 100 outputs/dia = 100 human reviews/dia? ├─ Impossível, caro, não escala └─ Resultado: Você nunca valida (e agente erra)
Como Sakana resolveu (Multi-Layered Review)
SAKANA AI: PEER REVIEW AUTOMÁTICO (MLR System)
Ideia central: └─ LLM consegue revisar outputs de outro LLM? └─ Sim, MAS precisa treinar pra detectar erros └─ Não é só copiar formato (everyone faz isso) └─ É detectar ERROS (hard problem)
Abordagem Sakana (Multi-Layered Review):
Layer 1: Contradiction Detection
├─ Sistema lê: Claim A, Claim B
├─ Detecta: "A contradiz B?"
├─ Usa: Semantic similarity + logic
├─ Accuracy: ~65%
└─ Fácil (contradições são óbvias)
Layer 2: Evidence Validation
├─ Sistema lê: Claim + evidence
├─ Detecta: "Evidence suporta claim?"
├─ Verifica: Citations, data, logic
├─ Accuracy: ~70%
└─ Medium (requer fact-checking)
Layer 3: Core-Claim Error Detection (THE HARD ONE)
├─ Sistema lê: Core claim (main argument)
├─ Detecta: "Claim é verdadeiro/falso?"
├─ Requer: Deep reasoning, knowledge
├─ Accuracy: **73%** ✓✓
└─ Hard (requer expertise)
Resultado: 73% de erros detectados (impressionante) └─ Layer 1 + Layer 2 = ~65% (óbvios) └─ Layer 3 = adicional 8% (insights) └─ Total: 73% (muito bom)
Benchmark: ├─ Humano reviewer: ~80% (não é 100% perfeito) ├─ Sakana system: 73% ├─ Gap: 7% (muito pequeno) └─ Implicação: IA está NO MESMO NÍVEL que human
Por que 73% é revolucionário
COMPARATIVO: Error detection rate
┌──────────────────────────────────────┐ │ No validation (seu agente hoje): │ │ Error detection rate: 0% │ │ Erros passando: 10-15% (unknown) │ └──────────────────────────────────────┘
┌──────────────────────────────────────┐ │ Random spot-check (you review 10%): │ │ Error detection rate: ~40% │ │ Erros passando: 6-9% │ │ Custo: 10 horas/mês human time │ └──────────────────────────────────────┘
┌──────────────────────────────────────┐ │ Sakana-style MLR system: │ │ Error detection rate: 73% │ │ Erros passando: 2-4% │ │ Custo: 0 human hours (automated) │ │ Tempo: Real-time (sub-second) │ └──────────────────────────────────────┘
IMPACTO: ├─ Erros reduzidos: 10-15% → 2-4% (70% reduction) ├─ Human time: 10h/mês → 0h (free) ├─ Latência: 3 dias (review) → 0s (real-time) ├─ Escala: 10 outputs/dia → 1000/dia (100x) └─ Trust: "Agente não é validado" → "Agente é confiável"
Como implementar MLR no seu agente (passo a passo)
Fase 1: Setup (1-2 semanas)
python class ValidatedAgent: def init(self): # Main agent (gera respostas) self.generator = ClaudeAPI()
# Validator agent (detecta erros)
self.validator = ClaudeAPI() # Different prompt
# Tracking
self.error_rate = 0.0
self.validation_log = []
def generate_and_validate(self, user_query: str) -> dict:
"""
Gera resposta + valida em 3 camadas
"""
# Step 1: Generator (seu agente)
response = self.generator.chat(user_query)
# Step 2: Layer 1 - Contradiction Detection
layer1 = self.detect_contradictions(response)
# Retorna: {has_contradiction: bool, confidence: 0-1}
# Step 3: Layer 2 - Evidence Validation
layer2 = self.validate_evidence(response)
# Retorna: {claims_supported: 0-1}
# Step 4: Layer 3 - Core-Claim Validation
layer3 = self.validate_core_claims(response)
# Retorna: {core_claims_valid: 0-1}
# Step 5: Aggregate (Sakana-style)
confidence = (
layer1['confidence'] * 0.3 +
layer2['claims_supported'] * 0.3 +
layer3['core_claims_valid'] * 0.4
)
# 73% accuracy = confidence > 0.73 = GOOD
# Step 6: Decision
if confidence > 0.73:
status = "VALID ✓"
return {"response": response, "status": status, "confidence": confidence}
else:
status = "QUESTIONABLE ⚠"
return {"response": response, "status": status, "confidence": confidence, "note": "Escalate to human"}
def detect_contradictions(self, response: str) -> dict:
"""
Layer 1: Detecta contradições lógicas
"""
prompt = f"""
Leia essa resposta e detecte contradições lógicas:
{response}
Responda APENAS com JSON:
{{
"has_contradiction": true/false,
"contradiction": "...",
"confidence": 0.0-1.0
}}
"""
result = self.validator.chat(prompt)
return json.loads(result)
def validate_evidence(self, response: str) -> dict:
"""
Layer 2: Valida se claims têm evidence
"""
prompt = f"""
Essa resposta tem claims. Cada claim tem evidence?
{response}
Score: 0 (sem evidence) até 1 (evidence sólida)
Responda APENAS com JSON:
{{
"claims_supported": 0.0-1.0,
"feedback": "..."
}}
"""
result = self.validator.chat(prompt)
return json.loads(result)
def validate_core_claims(self, response: str) -> dict:
"""
Layer 3: Valida core argument (hardest)
"""
prompt = f"""
Qual é o CORE CLAIM dessa resposta?
É verdadeiro? Falso? Uncertain?
{response}
Responda APENAS com JSON:
{{
"core_claim": "...",
"core_claims_valid": 0.0-1.0,
"reasoning": "..."
}}
"""
result = self.validator.chat(prompt)
return json.loads(result)
Fase 2: Deployment (1 week)
DEPLOYMENT STRATEGY:
Step 1: Test on staging ├─ Generate 100 sample outputs ├─ Run MLR validation ├─ Measure: Accuracy, latency, cost ├─ Expected: 73% error detection, 500ms latency └─ Cost: ~R$ 0.50/validation (using Claude)
Step 2: Monitor in production ├─ Enable MLR for 10% of outputs (canary) ├─ Track: Validation time, false positives, user impact ├─ If <500ms latency: expand to 50% ├─ If >1s: optimize prompts, reduce complexity └─ Goal: Full rollout in 2 weeks
Step 3: Full rollout ├─ Enable MLR for ALL outputs ├─ Tag outputs with confidence score ├─ Low confidence (<0.73): Escalate to human ├─ High confidence (>0.85): Auto-publish ├─ Medium: Show with disclaimer └─ Monitor error rate weekly
Real-world examples
EXAMPLE 1: Support agent (Tier 2 escalation)
User: "Why was my subscription cancelled?"
Agent generates: "Your subscription was cancelled because you requested it on October 15, 2024. We processed it immediately."
MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: is date in system?" → Query DB → YES ✓ ├─ Layer 3: "Core claim: user requested cancellation" → │ Query logs → YES ✓ ├─ Confidence: 0.92 (HIGH) └─ Result: "VALID ✓✓✓" (publish immediately)
Outcome: User gets instant, accurate answer (no escalation needed)
EXAMPLE 2: Sales agent (deal qualification)
Lead: "Can you support 1000 users on the Starter plan?"
Agent generates: "Yes, Starter plan supports up to 1000 users with unlimited API calls."
MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: does pricing table say this?" → │ Query pricing DB → NO ❌ │ (Starter = max 500 users) ├─ Confidence: 0.15 (LOW) └─ Result: "QUESTIONABLE ⚠" (escalate to human)
Outcome: Sales team catches error BEFORE sending (reputation saved)
EXAMPLE 3: BI agent (analysis)
User: "What's my MRR trend?"
Agent generates: "Your MRR grew 150% this month, from R$ 100K to R$ 250K."
MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: Math correct? 100K → 250K is 150%?" → │ YES ✓ ├─ Layer 3: "Check: Database confirms this?" → │ Query analytics → September MRR = 100K ✓ │ October MRR = 250K ✓ ├─ Confidence: 0.95 (VERY HIGH) └─ Result: "VALID ✓✓✓" (publish immediately)
Outcome: User makes confident decision based on validated data
Métricas que você deve rastrear
O dashboard de validação
┌─────────────────────────────────────────────────┐ │ VALIDATION DASHBOARD (real-time monitoring) │ ├─────────────────────────────────────────────────┤ │ │ │ 📊 Error Detection Rate: 73% │ │ ├─ Layer 1 (contradictions): 65% │ │ ├─ Layer 2 (evidence): 70% │ │ └─ Layer 3 (core claims): 73% │ │ │ │ ⚡ Validation Latency: 380ms │ │ ├─ Layer 1: 50ms │ │ ├─ Layer 2: 150ms │ │ └─ Layer 3: 180ms │ │ │ │ 💰 Cost per validation: R$ 0.48 │ │ ├─ Using: Claude 3.5 Sonnet (cheaper) │ │ ├─ 100 outputs/day = R$ 48/day │ │ ├─ Monthly: R$ 1.440/mês (cheap!) │ │ └─ ROI: Prevent 1 bad decision = ROI ✓✓ │ │ │ │ ✅ Valid outputs: 87% │ │ ├─ High confidence (>0.85): 70% │ │ ├─ Medium confidence (0.73-0.85): 17% │ │ └─ Low confidence (<0.73): 13% (escalate) │ │ │ │ 📈 Escalation rate: 13% │ │ ├─ Target: <15% │ │ ├─ Status: ✓ GOOD │ │ └─ Action: Monitor weekly │ │ │ │ 😊 User satisfaction: 92% (up from 76%) │ │ ├─ Before MLR: "Agente às vezes erra" │ │ ├─ After MLR: "Agente é confiável" │ │ └─ NPS: +15 points (massive!) │ │ │ └─────────────────────────────────────────────────┘
ACÇÃO SEMANAL:
- Review escalation rate (target: <15%)
- Analyze false positives (low confidence but correct)
- Optimize prompts (reduce false positives)
- Monitor cost (target: <R$ 0.50/validation)
- Update model choice if needed (switch to cheaper LLM)
- Report to board: "Error rate ↓ 70%, User satisfaction ↑ 15%"
Checklist: Quando implementar MLR
☐ Seu agente gera outputs (respostas, análises, decisões)? ☐ Usuários confiam nessas respostas? ☐ Erros custam (credibilidade, revenue, churn)? ☐ Você NUNCA valida em escala (manual review = impossível)? ☐ Você quer evitar alucinação/fake outputs? ☐ Você quer escalar sem sacrificar qualidade? ☐ Você tem budget R$ 1.5K-3K/mês (validation infrastructure)?
Score: └─ <3 SIM: MLR talvez não seja priority agora └─ 3-5 SIM: MLR é IMPORTANTE (implement em 4 semanas) └─ >5 SIM: MLR é CRÍTICO (implement AGORA, este mês)
Se você checou >5: Seu agente PRECISA de validação automática
Comparação: MLR vs alternativas
╔═════════════════════╦═══════════════╦════════════════╦══════════════╗ ║ Abordagem ║ Accuracy ║ Custo (mês) ║ Escalabilidade║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Sem validação ║ 0% (unknown) ║ R$ 0 ║ Infinite ❌ ║ ║ (seu agente hoje) ║ ║ (mas perde $) ║ (mas breaks) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Manual review ║ 85% ║ R$ 15K+ ║ 10/dia ❌ ║ ║ (1 human per 100) ║ ║ (very expensive)║ (not scalable)║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Simple checklist ║ 45% ║ R$ 500 ║ 1000/day ✓ ║ ║ (regex rules) ║ ║ (cheap) ║ (but dumb) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ MLR (Sakana-style) ║ 73% ✓✓✓ ║ R$ 1.5K-3K ║ 10K/day ✓✓✓ ║ ║ (LLM-based) ║ (very good) ║ (reasonable) ║ (enterprise) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Full human review ║ 95% ║ R$ 50K+ ║ 5/day ❌ ║ ║ (gold standard) ║ ║ (prohibitive) ║ (impossible) ║ ╚═════════════════════╩═══════════════╩════════════════╩══════════════╝
RECOMENDAÇÃO: ✓ Melhor trade-off: MLR (73% accuracy, R$ 2K/mês, 10K/day) ✓ Implementa hoje: Detecta 73% de erros automaticamente ✓ Escala conforme: 100 → 1000 → 10K outputs/dia (sem custo linear) ✓ Única problema: Requer setup (2 semanas pra implementar)
Conclusão: Validação é feature
Fatos:
✓ Sakana AI detecta 73% de core-claim errors (automático) ✓ Seu agente: Detecta 0% (porque não valida) ✓ Diferença: 73% error detection = +50% quality perception ✓ Custo: R$ 2K/mês (muito cheaper que human review) ✓ Latência: 300ms (real-time, não 3 dias) ✓ Escala: 10K outputs/dia (unlimited) ✓ Implementação: 2-3 semanas (not hard) ✓ ROI: 1 prevented bad decision = pays for entire system ✓ User trust: Aumenta drasticamente (users percebem qualidade)
Proximo passo: └─ HOJE: Decide: implementar MLR ou continue com 0% validation? └─ Se SIM: Allocate 2-3 semanas + R$ 2K/mês budget └─ Se NÃO: Continue arriscando (agente erra 10-15%) └─ Recommendation: MLR é game-changer (do it)
Problema resolvido quando: └─ Seu agente tem MLR system running └─ Detectando 73%+ de erros (automático) └─ Usuários confiam nas respostas └─ Error rate cai para 2-4% (vs 10-15%) └─ User satisfaction sobe (NPS ↑) └─ You sleep knowing agente é validado
→ OpenClaw: Agentes com MLR Validation (Sakana-style, built-in)
Sakana detecta 73% de erros automaticamente. Seu agente? ZERO. Implementa MLR HOJE. Validação em escala = confiabilidade. 🚀
Publicado em 11 de outubro de 2026