Notícias
Notícias
5 min de leitura
10 de outubro de 2026

Cloudflare Clef-omni: Agente vê + ouve (barato)

Cloudflare Clef-omni: Modelo open-weight (audio + video + text). Agentes SaaS ganham visão. 10x mais barato que OpenAI. Alternativa viável.

Equipe OpenClaw

Equipe OpenClaw · Time de Engenharia & Produto

A Equipe OpenClaw é formada por engenheiros, designers e especialistas em IA dedicados a construir a melhor plataforma de agentes conversacionais para negócios brasileiros. Combinamos expertise…


Cloudflare Clef-omni: Agente vê + ouve (barato)

Notícia: Cloudflare lançou Clef-omni: modelo open-weight que processa áudio, vídeo, texto e imagem (multimodal completo). Além disso, Clef-flash ficou 10x mais barato que alternativas (mais barato que Janus/OpenAI Vision).

Implicação: Se você tem agente de atendimento/suporte, finalmente pode integrar visão + som sem gastar R$ 100K/mês.

**"Você é CTO de contact center com agente WhatsApp.

Cenário antigo (agente é text-only): ├─ Cliente: "Meu produto tá quebrado, olha aqui!" ├─ Cliente: Envia foto + vídeo ├─ Agente: "Desculpa, não consigo ver imagem/vídeo" ├─ Cliente: Furioso ├─ Agente: "Só consigo ler texto. Você descreve?" ├─ Cliente: "Não! Você tem olhos, né?" ├─ Resultado: Atendimento fracassa └─ Custo: Escala pra humano (R$ 5K/mês por agente)

Cenário novo (Clef-omni): ├─ Cliente: "Meu produto tá quebrado, olha!" ├─ Cliente: Envia foto + vídeo + áudio ("tá fazendo barulho estranho") ├─ Agente (Clef-omni): Vê foto, assiste vídeo, ouve áudio ├─ Agente: "Vi o problema. Tá travado. Deixa eu ajudar..." ├─ Cliente: "Ótimo! Você entendeu de primeira!" ├─ Resultado: Atendimento perfeito └─ Custo: Agente automático (R$ 50/mês por 1000 chats) "**


O problema: Agentes blind (cegos) em mundo visual

Limitação antiga (text-only agents)

Cliente envia: ├─ Foto de erro ├─ Vídeo do bug ├─ Áudio descrevendo problema └─ Tudo isso junto

Agente text-only: ├─ Lê: "Você enviou arquivo.jpg" ├─ Não consegue: Ver a foto ├─ Não consegue: Assitir vídeo ├─ Não consegue: Ouvir áudio ├─ Resultado: "Posso ajudar se você descrever?" └─ Cliente fica furioso (agente é inútil)

Problemática: ├─ 80% dos problemas são VISUAIS (screenshot de erro) ├─ 10% são AUDITIVOS (barulho, voz do cliente) ├─ Agente que não consegue ver/ouvir = agent fail └─ Fallback: Human agent (caro)

Solução cara (OpenAI Vision API)

Antes (Clef-omni): ├─ Usar OpenAI Vision (GPT-4 Vision): R$ 0.01 por imagem ├─ Usar OpenAI Whisper: R$ 0.0001 por minuto áudio ├─ Usar OpenAI Video: ??? (não existe, precisa descomposição) ├─ Volume: 1000 chats/dia com foto ├─ Custo/mês: 1000 × 30 × R$ 0.01 = R$ 300/mês (foto only) ├─ Se adicionar áudio: +R$ 100/mês ├─ Se adicionar vídeo: CARO (custom solution needed) └─ Total: R$ 400-1000/mês (e ainda é caro pra scale)

Depois (Clef-omni open-weight): ├─ Usar Cloudflare Clef-omni: Self-hosted / Workers ├─ Custo: R$ 0 (open-weight, você roda) ├─ Ou: Cloudflare API: ~R$ 0.001 por request (100x mais barato) ├─ Volume: 1000 chats/dia com foto + vídeo + áudio ├─ Custo/mês: 1000 × 30 × R$ 0.001 = R$ 30/mês └─ Economia: 300-1000% menos que OpenAI


O que é Clef-omni (arquitetura)

Capacidades

Clef-omni pode processar: ├─ TEXT │ └─ "Meu produto não tá funcionando" ├─ IMAGE │ └─ Screenshot de erro (JPEG, PNG, WebP) ├─ VIDEO │ └─ Vídeo do problema (MP4, WebM, até 60 segundos) ├─ AUDIO │ └─ Cliente descrevendo problema (MP3, WAV, Opus) └─ TUDO JUNTO (multimodal) └─ Cliente: foto + vídeo + áudio + texto └─ Agente: processa tudo em paralelo └─ Resposta: Mais precisa (contexto 360°)

Performance vs OpenAI

┌─────────────────┬──────────────┬─────────────┬──────────┐ │ Capability │ Clef-omni │ GPT-4V │ Claude 3 │ ├─────────────────┼──────────────┼─────────────┼──────────┤ │ Text │ ✅ Rápido │ ✅ Rápido │ ✅ Lento │ │ Image │ ✅ Rápido │ ✅ Rápido │ ✅ Rápido│ │ Video │ ✅ Sim │ ❌ Não │ ❌ Não │ │ Audio │ ✅ Sim │ ❌ Não │ ❌ Não │ │ Multimodal │ ✅ Nativo │ ❌ Hackish │ ❌ Não │ │ Latência │ <500ms │ 1-2s │ 2-5s │ │ Custo │ R$ 0.001 │ R$ 0.01 │ R$ 0.005 │ │ Open-weight? │ ✅ Sim │ ❌ Não │ ❌ Não │ └─────────────────┴──────────────┴─────────────┴──────────┘

Winner: Clef-omni (speed + multimodal + cost)

Exemplo real: Análise de screenshot

OpenAI Vision (caro):

python import openai import base64

Encode imagem

with open("screenshot.png", "rb") as f: image_data = base64.b64encode(f.read()).decode()

Send pra OpenAI Vision

response = openai.ChatCompletion.create( model="gpt-4-vision", messages=[ { "role": "user", "content": [ {"type": "text", "text": "O que tem de errado nessa screenshot?"}, {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_data}"}} ] } ] )

print(response.choices[0].message.content)

Cost: R$ 0.01 por imagem

Clef-omni (barato + open-weight):

python import requests

Option 1: Self-hosted (R$ 0)

response = requests.post( "http://localhost:8000/analyze", files={"image": open("screenshot.png", "rb")}, data={"prompt": "O que tem de errado nessa screenshot?"} )

Option 2: Cloudflare Workers (R$ 0.001)

response = requests.post( "https://api.cloudflare.com/client/v4/ai/run/clef-omni", headers={"Authorization": f"Bearer {token}"}, files={"image": open("screenshot.png", "rb")}, data={"prompt": "O que tem de errado?"} )

print(response.json()["result"])

Cost: R$ 0 (self-hosted) or R$ 0.001 (API)

Savings: 100-1000x


Real-world use cases: Agentes multimodal

Use case 1: Customer support visual

Problema: Cliente envia foto de erro (produto quebrado, packaging danificado)

Antes (agente text-only):

Cliente: [envia foto] Agente: "Não consigo ver. Você pode descrever?" Cliente: "Sério? Tá explícito na foto!" Fallback: Human agent (caro)

Depois (Clef-omni):

Cliente: [envia foto] Agente (Clef-omni): ├─ Vê a foto ├─ Identifica: "Tela quebrada (canto superior direito)" ├─ Oferece: "Você quer replacement?" └─ Resolve em 30 segundos Resultado: Customer happy, zero human handoff

Use case 2: Tech support com vídeo

Problema: Cliente grava vídeo mostrando bug (aplicação travando)

Antes:

Cliente: [envia vídeo] Agente: "Não consigo processar vídeo" Cliente: Envia screenshot em vez disso (perde contexto) Agente: Análise incompleta Resultado: Ticket aberto (escalação desnecessária)

Depois (Clef-omni):

Cliente: [envia vídeo 30 segundos] Agente (Clef-omni): ├─ Assiste vídeo inteiro ├─ Identifica: "Aplicação travando quando clica em botão 'Export'" ├─ Root cause: "Timeout na API de upload" ├─ Solução: "Atualize app pra v2.5 (fix incluído)" └─ Previne: Customer não precisa abrir ticket Resultado: Self-service resolvido, zero suporte humano

Use case 3: Call center com áudio

Problema: Agente de suporte precisa analisar áudio de cliente (entender emoção, contexto, sotaque)

Antes:

Cliente: Deixa mensagem de voz (reclamando) Agente: "Desculpa, só leio texto. Você escreve?" Cliente: "NÃO! Você ouve ou não?" Fallback: Human agent (necessário)

Depois (Clef-omni):

Cliente: [envia áudio 60 segundos reclamando] Agente (Clef-omni): ├─ Processa áudio via Clef-omni ├─ Transcreve: "Meu pedido tá 10 dias atrasado!" ├─ Sente: Frustração alta (tom elevado) ├─ Prioriza: "Isso é urgente. Vou checar rastreamento." ├─ Responde: [áudio ou texto]: "Seu pedido saiu hoje. Desculpa o atraso." └─ Resolve: Antes que cliente pense em cancelar Resultado: Retenção, zero escalação

Use case 4: Marketplace (foto + descrição)

Problema: Vendedor envia foto de produto + áudio descrevendo detalhe

Antes:

Vendedor: [foto + áudio] Agente: Processa só foto (ignora áudio) Resultado: Análise incompleta (falta contexto de voz)

Depois (Clef-omni multimodal):

Vendedor: [foto + áudio: "Esse é importado, muito raro"] Agente (Clef-omni): ├─ Vê a foto: Identifica produto X ├─ Ouve áudio: Entende é importado/raro ├─ Combina contextos: Aumenta preço de listagem ├─ Valida: "Ótimo, pronto para vender" └─ Publica automático Resultado: Onboarding mais rápido, sem revisão manual


Comparação: Clef-omni vs alternativas

Clef-omni (Cloudflare)

✅ Multimodal nativo (texto + imagem + vídeo + áudio) ✅ Open-weight (rode localmente, zero API cost) ✅ Barato (R$ 0.001 por request via Cloudflare) ✅ Rápido (<500ms latência) ✅ Sem rate limiting agressivo ❌ Menor comunidade (novo) ❌ Menos fine-tuning docs ❌ Cloudflare lock-in (se usar API)

Melhor pra: SaaS que quer custo baixo + multimodal

GPT-4V (OpenAI)

✅ Melhor acurácia (estado da arte) ✅ Maior comunidade / docs ✅ Integrado com ChatGPT ecosystem ❌ Caro (R$ 0.01 por imagem) ❌ Não é multimodal (sem vídeo nativo) ❌ Rate limiting (429 errors comum) ❌ Latência variável (1-2s)

Melhor pra: Aplicações onde precisão importa mais que custo

Claude 3 (Anthropic)

✅ Bom em análise de código/texto (imagem) ✅ Contexto mais longo (200K tokens) ❌ Sem vídeo / áudio (não é multimodal) ❌ Caro (R$ 0.005 por imagem) ❌ Lento (2-5s latência)

Melhor pra: Análise de documento (texto + imagem), não agentes

Janus (Alibaba/open)

✅ Open-weight multimodal ✅ Barato (R$ 0) ❌ Mais lento (Clef-omni 2x mais rápido) ❌ Menos preciso em vídeo ❌ Comunidade pequena

Melhor pra: Hobbyists, não produção

Resumo:

Para agentes B2B SaaS: └─ Clef-omni = Best of all worlds ├─ Multimodal + rápido + barato + open-weight ├─ Cloudflare ecosystem = bonus └─ Recomendação: Use Clef-omni


Implementação: Agente multimodal com Clef-omni

Arquitetura

┌──────────────────────────┐ │ Cliente envia │ │ - Texto │ │ - Imagem/Screenshot │ │ - Vídeo (até 60s) │ │ - Áudio │ └────────────┬─────────────┘ │ ▼ ┌──────────────────────────┐ │ Cloudflare Clef-omni │ │ (Multimodal Processor) │ │ - Processa tudo │ │ - Em paralelo (rápido) │ └────────────┬─────────────┘ │ ▼ ┌──────────────────────────┐ │ Agent Logic │ │ (Claude / Gpt-4) │ │ - Decide ação │ │ - Escreve resposta │ └────────────┬─────────────┘ │ ▼ ┌──────────────────────────┐ │ Resposta ao cliente │ │ (Texto / Áudio / Ação) │ └──────────────────────────┘

Código (example)

python import anthropic import requests import base64 from pathlib import Path

class ClefOmniAgent: def init(self): self.cloudflare_api = "https://api.cloudflare.com/client/v4/ai/run/clef-omni" self.claude = anthropic.Anthropic() self.token = "your-cloudflare-token"

def analyze_multimodal(self, text=None, image_path=None, video_path=None, audio_path=None):
    """
    Processa múltiplos tipos de mídia com Clef-omni
    """
    
    # Build request pra Clef-omni
    files = {}
    data = {"prompt": text or "Analise isto"}
    
    if image_path:
        files["image"] = open(image_path, "rb")
    if video_path:
        files["video"] = open(video_path, "rb")
    if audio_path:
        files["audio"] = open(audio_path, "rb")
    
    # Call Clef-omni
    response = requests.post(
        self.cloudflare_api,
        headers={"Authorization": f"Bearer {self.token}"},
        files=files,
        data=data,
        timeout=30  # Clef-omni é rápido (<500ms)
    )
    
    # Resultado: análise multimodal
    analysis = response.json()["result"]
    return analysis

def respond_to_customer(self, customer_input):
    """
    Agente completo: Processa input (multimodal) → Responde
    """
    
    text = customer_input.get("text")
    image = customer_input.get("image")
    video = customer_input.get("video")
    audio = customer_input.get("audio")
    
    # Step 1: Analyze com Clef-omni
    analysis = self.analyze_multimodal(
        text=text,
        image_path=image,
        video_path=video,
        audio_path=audio
    )
    
    # Step 2: Claude decide ação
    message = self.claude.messages.create(
        model="claude-3-5-sonnet",
        max_tokens=1024,
        messages=[
            {
                "role": "user",
                "content": f"""
                Cliente input: {text}
                Clef-omni analysis: {analysis}
                
                Como você responde? Seja helpful, direto, resolva o problema.
                """
            }
        ]
    )
    
    # Step 3: Resposta
    response = message.content[0].text
    return {
        "clef_analysis": analysis,
        "agent_response": response,
        "cost_estimate": "R$ 0.001"
    }

Usage

agent = ClefOmniAgent()

Customer envia: texto + foto + vídeo

customer_input = { "text": "Meu produto tá com defeito", "image": "screenshot.png", "video": "bug_demo.mp4" }

result = agent.respond_to_customer(customer_input) print(f"Resposta: {result['agent_response']}") print(f"Custo: {result['cost_estimate']}")

Output:

Resposta: Vi o problema na sua screenshot. Tá travando quando...

Custo: R$ 0.001


Pricing: Clef-omni vs OpenAI Vision

Cenário: 10K chats/dia com foto + vídeo

OpenAI Vision: ├─ Imagem: 10K × R$ 0.01 = R$ 100/dia ├─ Vídeo: NÃO SUPORTA (precisa custom) ├─ Alternativa: GPT-4 32K tokens = R$ 500/mês ├─ Total: R$ 3K-5K/mês └─ Scale: Começa caro

Cloudflare Clef-omni (API): ├─ Imagem + vídeo: 10K × R$ 0.001 = R$ 10/dia ├─ Total: R$ 300/mês └─ Scale: Custo cai com volume

Cloudflare Clef-omni (self-hosted): ├─ Deploy: Seu servidor (R$ 0 API) ├─ Custo: Só infra (GPU/CPU) = R$ 500/mês ├─ Total: R$ 500/mês (fixed, não cresce) └─ Break-even: 500K+ requests/mês

Economia (10K chats/dia): └─ OpenAI → Clef-omni API: 10x mais barato └─ OpenAI → Clef-omni self-hosted: 10-20x mais barato (longterm)


Conclusão: Agentes multimodal são agora viável

Antes (2024):

Agentes são text-only ├─ Não conseguem ver fotos ├─ Não conseguem assitir vídeos ├─ Não conseguem ouvir áudio └─ Precisam fallback pra human (caro)

Se quisesse multimodal: └─ OpenAI Vision (R$ 0.01/imagem) + workarounds └─ Resultado: Caro, incompleto, lento

Agora (2025):

Clef-omni muda tudo: ├─ Nativo: Texto + imagem + vídeo + áudio ├─ Barato: R$ 0.001 por request (100x mais barato) ├─ Rápido: <500ms latência ├─ Open: Open-weight, rode você mesmo (R$ 0) └─ Resultado: Agentes multimodal são finalmente viável

Impacto: ├─ Support agents podem resolver 80% de tickets SEM human ├─ Sales agents podem ver portfolio do cliente (contexto melhor) ├─ Field agents podem filmar problema, agente resolve automático └─ Conversão: Maior (agente multimodal é mais útil)

Bottom line:

Antes: "Agente? Tá bom, mas não consegue ver nada." Depois: "Clef-omni? Vê, ouve, entende. É tipo um human agent."

Para SaaS que quer: ├─ Agentes baratos (~R$ 300-500/mês) ├─ Que conseguem ver/ouvir ├─ Que não dependem de OpenAI └─ Clef-omni = solução perfeita

→ OpenClaw: Agentes Multimodal com Clef-omni (ready to deploy)

Seu agente tá blind? Hora de dar visão (e audição) a ele. 🚀


Publicado em 10 de outubro de 2026

Leia também