Notícias
Notícias
5 min de leitura
11 de outubro de 2026

Seu agente detecta 73% de erros? (validação em escala)

Sakana AI: Peer review automático detecta 73% de erros. Seu agente? Como validar qualidade em escala. MLR system.

Equipe OpenClaw

Equipe OpenClaw · Time de Engenharia & Produto

A Equipe OpenClaw é formada por engenheiros, designers e especialistas em IA dedicados a construir a melhor plataforma de agentes conversacionais para negócios brasileiros. Combinamos expertise…


Seu agente detecta 73% de erros? (validação em escala)

Notícia: Sakana AI publicou research em peer review automático (LLM-assisted). Sistema deles: detecta 73% de core-claim errors em papers. Não é só "copiar review humano" (como outros fazem). É detectar erros plantados deliberadamente. Implicação: Se Sakana consegue detectar 73% de erros com peer review automático, seu agente PODE estar validando outputs com mesma precision.

Problema: Seu agente gera conteúdo/análise/decisões. Você NUNCA valida em escala. Sakana mostrou que é POSSÍVEL. Pergunta: **Por que você não tá fazendo?

**"Você é CEO de SaaS com agente gerando conteúdo.

Cenário: Agente sem validação ├─ Agente gera: 100 respostas/dia ├─ Qualidade: Unknown (nunca validou) ├─ Erros: 5-15% (estimado, você não sabe) ├─ Consequência: Usuários recebem content fake ├─ Trust: Quebrado (gradualmente) ├─ Churn: Aumenta (users percebem qualidade ruim) └─ Revenue: Diminui (churn = lost MRR)

Cenário: Agente com validação (Sakana-style) ├─ Agente gera: 100 respostas/dia ├─ Sistema valida: 73% dos erros detectados ├─ Erros passando: 1-4% (muito melhor) ├─ Qualidade: Validada, confiável ├─ Trust: Mantém (users confiam) ├─ Churn: Baixo (quality é good) └─ Revenue: Cresce (retention ↑)

Diferença: 73% error detection = +50% quality perception "**


Como Sakana detecta 73% de erros (e por que importa)

O problema com peer review tradicional

PEER REVIEW HUMANO (académico):

Process: ├─ Author escreve paper ├─ Envia pra conference/journal ├─ Editor designa reviewers (3-5 humans) ├─ Reviewers leem (8-20 horas cada) ├─ Escrevem review (2-5 horas cada) ├─ Total: 40-150 horas humanas por paper ├─ Tempo: 3-6 meses └─ Custo: ~R$ 20K por paper (estimado)

Problema: ├─ Lento (6 meses pra resultado) ├─ Caro (R$ 20K) ├─ Não escala (não tem reviewers suficientes) ├─ Subjetivo (reviewer A acha bom, B acha ruim) └─ Incompleto (reviewer pode miss erros)

Aplicação em SaaS: ├─ Você teria que revisar cada agente output? ├─ 100 outputs/dia = 100 human reviews/dia? ├─ Impossível, caro, não escala └─ Resultado: Você nunca valida (e agente erra)

Como Sakana resolveu (Multi-Layered Review)

SAKANA AI: PEER REVIEW AUTOMÁTICO (MLR System)

Ideia central: └─ LLM consegue revisar outputs de outro LLM? └─ Sim, MAS precisa treinar pra detectar erros └─ Não é só copiar formato (everyone faz isso) └─ É detectar ERROS (hard problem)

Abordagem Sakana (Multi-Layered Review):

Layer 1: Contradiction Detection
  ├─ Sistema lê: Claim A, Claim B
  ├─ Detecta: "A contradiz B?"
  ├─ Usa: Semantic similarity + logic
  ├─ Accuracy: ~65%
  └─ Fácil (contradições são óbvias)

Layer 2: Evidence Validation
  ├─ Sistema lê: Claim + evidence
  ├─ Detecta: "Evidence suporta claim?"
  ├─ Verifica: Citations, data, logic
  ├─ Accuracy: ~70%
  └─ Medium (requer fact-checking)

Layer 3: Core-Claim Error Detection (THE HARD ONE)
  ├─ Sistema lê: Core claim (main argument)
  ├─ Detecta: "Claim é verdadeiro/falso?"
  ├─ Requer: Deep reasoning, knowledge
  ├─ Accuracy: **73%** ✓✓
  └─ Hard (requer expertise)

Resultado: 73% de erros detectados (impressionante) └─ Layer 1 + Layer 2 = ~65% (óbvios) └─ Layer 3 = adicional 8% (insights) └─ Total: 73% (muito bom)

Benchmark: ├─ Humano reviewer: ~80% (não é 100% perfeito) ├─ Sakana system: 73% ├─ Gap: 7% (muito pequeno) └─ Implicação: IA está NO MESMO NÍVEL que human

Por que 73% é revolucionário

COMPARATIVO: Error detection rate

┌──────────────────────────────────────┐ │ No validation (seu agente hoje): │ │ Error detection rate: 0% │ │ Erros passando: 10-15% (unknown) │ └──────────────────────────────────────┘

┌──────────────────────────────────────┐ │ Random spot-check (you review 10%): │ │ Error detection rate: ~40% │ │ Erros passando: 6-9% │ │ Custo: 10 horas/mês human time │ └──────────────────────────────────────┘

┌──────────────────────────────────────┐ │ Sakana-style MLR system: │ │ Error detection rate: 73% │ │ Erros passando: 2-4% │ │ Custo: 0 human hours (automated) │ │ Tempo: Real-time (sub-second) │ └──────────────────────────────────────┘

IMPACTO: ├─ Erros reduzidos: 10-15% → 2-4% (70% reduction) ├─ Human time: 10h/mês → 0h (free) ├─ Latência: 3 dias (review) → 0s (real-time) ├─ Escala: 10 outputs/dia → 1000/dia (100x) └─ Trust: "Agente não é validado" → "Agente é confiável"


Como implementar MLR no seu agente (passo a passo)

Fase 1: Setup (1-2 semanas)

python class ValidatedAgent: def init(self): # Main agent (gera respostas) self.generator = ClaudeAPI()

    # Validator agent (detecta erros)
    self.validator = ClaudeAPI()  # Different prompt
    
    # Tracking
    self.error_rate = 0.0
    self.validation_log = []

def generate_and_validate(self, user_query: str) -> dict:
    """
    Gera resposta + valida em 3 camadas
    """
    
    # Step 1: Generator (seu agente)
    response = self.generator.chat(user_query)
    
    # Step 2: Layer 1 - Contradiction Detection
    layer1 = self.detect_contradictions(response)
    # Retorna: {has_contradiction: bool, confidence: 0-1}
    
    # Step 3: Layer 2 - Evidence Validation
    layer2 = self.validate_evidence(response)
    # Retorna: {claims_supported: 0-1}
    
    # Step 4: Layer 3 - Core-Claim Validation
    layer3 = self.validate_core_claims(response)
    # Retorna: {core_claims_valid: 0-1}
    
    # Step 5: Aggregate (Sakana-style)
    confidence = (
        layer1['confidence'] * 0.3 +
        layer2['claims_supported'] * 0.3 +
        layer3['core_claims_valid'] * 0.4
    )
    # 73% accuracy = confidence > 0.73 = GOOD
    
    # Step 6: Decision
    if confidence > 0.73:
        status = "VALID ✓"
        return {"response": response, "status": status, "confidence": confidence}
    else:
        status = "QUESTIONABLE ⚠"
        return {"response": response, "status": status, "confidence": confidence, "note": "Escalate to human"}

def detect_contradictions(self, response: str) -> dict:
    """
    Layer 1: Detecta contradições lógicas
    """
    prompt = f"""
    Leia essa resposta e detecte contradições lógicas:
    
    {response}
    
    Responda APENAS com JSON:
    {{
        "has_contradiction": true/false,
        "contradiction": "...",
        "confidence": 0.0-1.0
    }}
    """
    result = self.validator.chat(prompt)
    return json.loads(result)

def validate_evidence(self, response: str) -> dict:
    """
    Layer 2: Valida se claims têm evidence
    """
    prompt = f"""
    Essa resposta tem claims. Cada claim tem evidence?
    
    {response}
    
    Score: 0 (sem evidence) até 1 (evidence sólida)
    Responda APENAS com JSON:
    {{
        "claims_supported": 0.0-1.0,
        "feedback": "..."
    }}
    """
    result = self.validator.chat(prompt)
    return json.loads(result)

def validate_core_claims(self, response: str) -> dict:
    """
    Layer 3: Valida core argument (hardest)
    """
    prompt = f"""
    Qual é o CORE CLAIM dessa resposta?
    É verdadeiro? Falso? Uncertain?
    
    {response}
    
    Responda APENAS com JSON:
    {{
        "core_claim": "...",
        "core_claims_valid": 0.0-1.0,
        "reasoning": "..."
    }}
    """
    result = self.validator.chat(prompt)
    return json.loads(result)

Fase 2: Deployment (1 week)

DEPLOYMENT STRATEGY:

Step 1: Test on staging ├─ Generate 100 sample outputs ├─ Run MLR validation ├─ Measure: Accuracy, latency, cost ├─ Expected: 73% error detection, 500ms latency └─ Cost: ~R$ 0.50/validation (using Claude)

Step 2: Monitor in production ├─ Enable MLR for 10% of outputs (canary) ├─ Track: Validation time, false positives, user impact ├─ If <500ms latency: expand to 50% ├─ If >1s: optimize prompts, reduce complexity └─ Goal: Full rollout in 2 weeks

Step 3: Full rollout ├─ Enable MLR for ALL outputs ├─ Tag outputs with confidence score ├─ Low confidence (<0.73): Escalate to human ├─ High confidence (>0.85): Auto-publish ├─ Medium: Show with disclaimer └─ Monitor error rate weekly

Real-world examples

EXAMPLE 1: Support agent (Tier 2 escalation)

User: "Why was my subscription cancelled?"

Agent generates: "Your subscription was cancelled because you requested it on October 15, 2024. We processed it immediately."

MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: is date in system?" → Query DB → YES ✓ ├─ Layer 3: "Core claim: user requested cancellation" → │ Query logs → YES ✓ ├─ Confidence: 0.92 (HIGH) └─ Result: "VALID ✓✓✓" (publish immediately)

Outcome: User gets instant, accurate answer (no escalation needed)


EXAMPLE 2: Sales agent (deal qualification)

Lead: "Can you support 1000 users on the Starter plan?"

Agent generates: "Yes, Starter plan supports up to 1000 users with unlimited API calls."

MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: does pricing table say this?" → │ Query pricing DB → NO ❌ │ (Starter = max 500 users) ├─ Confidence: 0.15 (LOW) └─ Result: "QUESTIONABLE ⚠" (escalate to human)

Outcome: Sales team catches error BEFORE sending (reputation saved)


EXAMPLE 3: BI agent (analysis)

User: "What's my MRR trend?"

Agent generates: "Your MRR grew 150% this month, from R$ 100K to R$ 250K."

MLR validates: ├─ Layer 1: "No contradictions" ✓ ├─ Layer 2: "Check: Math correct? 100K → 250K is 150%?" → │ YES ✓ ├─ Layer 3: "Check: Database confirms this?" → │ Query analytics → September MRR = 100K ✓ │ October MRR = 250K ✓ ├─ Confidence: 0.95 (VERY HIGH) └─ Result: "VALID ✓✓✓" (publish immediately)

Outcome: User makes confident decision based on validated data


Métricas que você deve rastrear

O dashboard de validação

┌─────────────────────────────────────────────────┐ │ VALIDATION DASHBOARD (real-time monitoring) │ ├─────────────────────────────────────────────────┤ │ │ │ 📊 Error Detection Rate: 73% │ │ ├─ Layer 1 (contradictions): 65% │ │ ├─ Layer 2 (evidence): 70% │ │ └─ Layer 3 (core claims): 73% │ │ │ │ ⚡ Validation Latency: 380ms │ │ ├─ Layer 1: 50ms │ │ ├─ Layer 2: 150ms │ │ └─ Layer 3: 180ms │ │ │ │ 💰 Cost per validation: R$ 0.48 │ │ ├─ Using: Claude 3.5 Sonnet (cheaper) │ │ ├─ 100 outputs/day = R$ 48/day │ │ ├─ Monthly: R$ 1.440/mês (cheap!) │ │ └─ ROI: Prevent 1 bad decision = ROI ✓✓ │ │ │ │ ✅ Valid outputs: 87% │ │ ├─ High confidence (>0.85): 70% │ │ ├─ Medium confidence (0.73-0.85): 17% │ │ └─ Low confidence (<0.73): 13% (escalate) │ │ │ │ 📈 Escalation rate: 13% │ │ ├─ Target: <15% │ │ ├─ Status: ✓ GOOD │ │ └─ Action: Monitor weekly │ │ │ │ 😊 User satisfaction: 92% (up from 76%) │ │ ├─ Before MLR: "Agente às vezes erra" │ │ ├─ After MLR: "Agente é confiável" │ │ └─ NPS: +15 points (massive!) │ │ │ └─────────────────────────────────────────────────┘

ACÇÃO SEMANAL:

  1. Review escalation rate (target: <15%)
  2. Analyze false positives (low confidence but correct)
  3. Optimize prompts (reduce false positives)
  4. Monitor cost (target: <R$ 0.50/validation)
  5. Update model choice if needed (switch to cheaper LLM)
  6. Report to board: "Error rate ↓ 70%, User satisfaction ↑ 15%"

Checklist: Quando implementar MLR

☐ Seu agente gera outputs (respostas, análises, decisões)? ☐ Usuários confiam nessas respostas? ☐ Erros custam (credibilidade, revenue, churn)? ☐ Você NUNCA valida em escala (manual review = impossível)? ☐ Você quer evitar alucinação/fake outputs? ☐ Você quer escalar sem sacrificar qualidade? ☐ Você tem budget R$ 1.5K-3K/mês (validation infrastructure)?

Score: └─ <3 SIM: MLR talvez não seja priority agora └─ 3-5 SIM: MLR é IMPORTANTE (implement em 4 semanas) └─ >5 SIM: MLR é CRÍTICO (implement AGORA, este mês)

Se você checou >5: Seu agente PRECISA de validação automática


Comparação: MLR vs alternativas

╔═════════════════════╦═══════════════╦════════════════╦══════════════╗ ║ Abordagem ║ Accuracy ║ Custo (mês) ║ Escalabilidade║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Sem validação ║ 0% (unknown) ║ R$ 0 ║ Infinite ❌ ║ ║ (seu agente hoje) ║ ║ (mas perde $) ║ (mas breaks) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Manual review ║ 85% ║ R$ 15K+ ║ 10/dia ❌ ║ ║ (1 human per 100) ║ ║ (very expensive)║ (not scalable)║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Simple checklist ║ 45% ║ R$ 500 ║ 1000/day ✓ ║ ║ (regex rules) ║ ║ (cheap) ║ (but dumb) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ MLR (Sakana-style) ║ 73% ✓✓✓ ║ R$ 1.5K-3K ║ 10K/day ✓✓✓ ║ ║ (LLM-based) ║ (very good) ║ (reasonable) ║ (enterprise) ║ ╠═════════════════════╬═══════════════╬════════════════╬══════════════╣ ║ Full human review ║ 95% ║ R$ 50K+ ║ 5/day ❌ ║ ║ (gold standard) ║ ║ (prohibitive) ║ (impossible) ║ ╚═════════════════════╩═══════════════╩════════════════╩══════════════╝

RECOMENDAÇÃO: ✓ Melhor trade-off: MLR (73% accuracy, R$ 2K/mês, 10K/day) ✓ Implementa hoje: Detecta 73% de erros automaticamente ✓ Escala conforme: 100 → 1000 → 10K outputs/dia (sem custo linear) ✓ Única problema: Requer setup (2 semanas pra implementar)


Conclusão: Validação é feature

Fatos:

✓ Sakana AI detecta 73% de core-claim errors (automático) ✓ Seu agente: Detecta 0% (porque não valida) ✓ Diferença: 73% error detection = +50% quality perception ✓ Custo: R$ 2K/mês (muito cheaper que human review) ✓ Latência: 300ms (real-time, não 3 dias) ✓ Escala: 10K outputs/dia (unlimited) ✓ Implementação: 2-3 semanas (not hard) ✓ ROI: 1 prevented bad decision = pays for entire system ✓ User trust: Aumenta drasticamente (users percebem qualidade)

Proximo passo: └─ HOJE: Decide: implementar MLR ou continue com 0% validation? └─ Se SIM: Allocate 2-3 semanas + R$ 2K/mês budget └─ Se NÃO: Continue arriscando (agente erra 10-15%) └─ Recommendation: MLR é game-changer (do it)

Problema resolvido quando: └─ Seu agente tem MLR system running └─ Detectando 73%+ de erros (automático) └─ Usuários confiam nas respostas └─ Error rate cai para 2-4% (vs 10-15%) └─ User satisfaction sobe (NPS ↑) └─ You sleep knowing agente é validado

→ OpenClaw: Agentes com MLR Validation (Sakana-style, built-in)

Sakana detecta 73% de erros automaticamente. Seu agente? ZERO. Implementa MLR HOJE. Validação em escala = confiabilidade. 🚀


Publicado em 11 de outubro de 2026

Leia também