Gateway online — inferência 100% própria, em CPU

Um roteador para os seus modelos Mangaba

Chaves, limites, consumo e playground num só painel. Seus apps falam OpenAI ou Anthropic sem mudar uma linha — trocando só a URL base.

client = OpenAI(
    base_url="https://app.mangaba.ia.br/v1",
    api_key="SUA_CHAVE",
)
client.chat.completions.create(
    model="Mangaba-Nordeste-Coder",
    messages=[{"role": "user", "content": "Olá!"}],
)

30 modelos em 3 provedores

Lista consultada agora em mangaba-nordeste, kleos, poc. Tudo em CPU, sem GPU. As velocidades são a mediana das chamadas reais que passaram pelo roteador nos últimos 30 dias — não número de folheto.

Mangaba-Qwen3-Coder-30B-A3B

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-30B - APELIDO LEGADO de Mangaba-Nordeste-Coder: desde 18/ago/2026 os dois nomes atendem no MESMO backend (127.0.0.1:8003), rodando Qwen3-Coder-30B-A3B-Instruct-Q4_K_M. Mantido para nao quebrar clientes antigos; em codigo novo prefira Mangaba-Nordeste-Coder. MoE de 30B totais com ~3,3B ativos por token: qualidade de modelo grande com latencia de modelo pequeno. Otimizado para portugues do Brasil, com foco agentico. QUANDO USAR: e o modelo PADRAO da casa - codigo, laco de agente com ferramentas, tarefas multi-turno, qualquer coisa que exija tool calling confiavel. Nome de modelo desconhecido cai aqui. QUANDO NAO USAR: classificacao ou roteamento de uma linha (o -LFM2.5-1.2B faz o mesmo mais barato) e leitura de imagem (use o -Qwen2.5-VL-7B). POR QUE E RAPIDO: MoE ativa so ~3,3B dos 30B por token, entao lê ~1,9 GB de peso por token em vez dos 17 GB do arquivo - em CPU o que pesa e parametro ATIVO, nao total. ACELERACAO: GWD (esqueleto de tool call semeado) + ngram, com 63-77%% de tokens especulados na 1a tool call. LIMITE: 65.536 tokens por requisicao; acima disso o backend retorna 400 (erro explicito, sem truncar em silencio). Servido pelo gateway. 23,2 tok/s geracao - 54,6 tok/s prompt - 20,5 tok/s tool call.

Qwen3-Coder-30B-A3B-Instruct · 30B totais · 3.3B ativos · contexto 65.536

Geração
20.1 tok/s
1º token
0.4s
Amostras
6

medido no tráfego real · também: Mangaba-Nordeste-Coder, Mangaba-Nordeste-30B

Mangaba-Qwen3.5-4B

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-4B - denso compacto (Qwen3.5) para respostas ageis em CPU. QUANDO USAR: perguntas curtas, reformulacao de texto, extracao simples, respostas de baixo custo com tool calling disponivel. E o meio-termo entre o -LFM2.5-1.2B (mais rapido, menos capaz) e o -Coder (mais capaz, MoE). QUANDO NAO USAR: laco agentico longo ou geracao de codigo - use o -Coder, que apesar de ser 30B e MAIS RAPIDO que este por ser MoE. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. 10,0 tok/s geracao - 15,1 tok/s prompt - 10,3 tok/s tool call.

Qwen3.5-4B · 4B · contexto 65.536

Geração
10.6 tok/s
1º token
0.7s
Amostras
3

medido no tráfego real · também: Mangaba-Nordeste-4B

Mangaba-GLM4.5-Air-106B

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-Air - GLM-4.5-Air 106B MoE (12B ativos), o de maior capacidade de raciocinio da casa. QUANDO USAR: problema que exige varios passos de raciocinio encadeado, analise longa, decisao dificil - casos em que a qualidade vale esperar. QUANDO NAO USAR: qualquer coisa trivial. E o MAIS LENTO por larga margem: uma tarefa que o -LFM2.5-1.2B resolve em ~6 s leva ~42 s aqui, e o resultado costuma ser o mesmo em tarefa simples. POR QUE E LENTO: le ~7,1 GB de peso por token (contra 1,9 GB do -Coder); o decode em CPU e limitado por banda de memoria, entao isso e um teto fisico, nao falta de ajuste. ACELERACAO: MTP nativo (camada NextN do GLM-4.5) + ngram. Migrado de Q4 para Q3 em 30/ago/2026: +19%% de geracao e +53%% em tool call. AQUECIMENTO: a 1a chamada apos ociosidade rende ~2,0 tok/s e as seguintes ~3,8 - descarte a primeira ao medir. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. ~5,6 tok/s geracao - 6,9 tok/s prompt - 4,3 tok/s tool call.

GLM-4.5-Air · 106B · contexto 65.536

Geração
4.4 tok/s
1º token
1.5s
Amostras
3

medido no tráfego real · também: Mangaba-Nordeste-Air

Mangaba-Qwen2.5-VL-7B

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-Vision - Qwen2.5-VL 7B, o unico modelo da casa que LE IMAGEM. QUANDO USAR: OCR, leitura de nota fiscal ou documento, descricao de foto, interpretacao de grafico ou print de tela. COMO CHAMAR: `content` vira uma LISTA com um item `text` e um item `image_url` - a url aceita data URI base64 (`data:image/png;base64,...`) ou http. QUANDO NAO USAR: conversa sem imagem (qualquer outro modelo e melhor) e fluxo com ferramentas - NAO faz tool calling. COLD START DE ~49 s: o Ollama descarrega o modelo apos inatividade; a 1a chamada depois de um periodo parado demora quase um minuto e as seguintes ~1,3 s. Se houver usuario esperando, aqueca com uma chamada trivial antes. ATENCAO - TRUNCA EM SILENCIO: janela de 8.192 tokens, e prompt maior NAO da erro; volta 200 com o excesso descartado. Medido: 40.000 tokens enviados viraram `prompt_tokens: 4098`. Confira `usage.prompt_tokens` contra o que voce mandou. Servido pelo gateway. 1,3 s por imagem (quente) - sem tool call.

Qwen2.5-VL-7B-Instruct · 7B · contexto 8.192

Geração
5.2 tok/s
1º token
1s
Amostras
3

medido no tráfego real · também: Mangaba-Nordeste-Vision

Mangaba-BGE-M3-568M

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-Embed - BGE-M3 multilingue, o unico modelo de EMBEDDINGS da casa. QUANDO USAR: busca semantica, RAG, deduplicacao, agrupamento por similaridade. COMO CHAMAR: `POST /v1/embeddings` (NAO /v1/chat/completions - este modelo nao conversa e nao gera texto). O campo `input` aceita uma string ou uma lista de strings; mandar em lote e bem mais eficiente que uma chamada por texto. SAIDA: vetores de 1024 dimensoes, um por texto de entrada, na mesma ordem. ATENCAO - TRUNCA EM SILENCIO acima de 8.192 tokens (roda via Ollama): fatie documentos longos em trechos antes de indexar, ou o vetor representara so o comeco do texto. Servido pelo gateway. 10 vetores em 2,45 s - sem geracao.

BAAI/bge-m3 · 568M · contexto 8.192

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria · também: Mangaba-Nordeste-Embed

Mangaba-LFM2.5-1.2B

tranquilo agoramangaba-nordeste

Mangaba-Nordeste-Flash - LFM2.5 1.2B, o MAIS RAPIDO da casa. QUANDO USAR: classificacao, roteamento de intencao, extracao de um campo, resposta curta, pre-filtro antes de acionar um modelo caro. E ~7x mais rapido que o -GLM4.5-Air-106B na mesma tarefa trivial. QUANDO NAO USAR: raciocinio de varios passos, codigo nao-trivial ou texto longo - o tamanho cobra o preco; tende a divagar e a ignorar instrucoes de formato rigidas. LIMITE: 32.768 tokens. Servido pelo gateway. 24,9 tok/s geracao - 63,7 tok/s prompt - 25,0 tok/s tool call.

LFM2.5-1.2B · 1.2B · contexto 32.768

Geração
63 tok/s
1º token
0.3s
Amostras
3

medido no tráfego real · também: Mangaba-Nordeste-Flash

Mangaba-Qwen2.5-7B

tranquilo agoramangaba-nordeste

Mangaba-Qwen2.5-7B - denso de 7B, geracao anterior (Qwen2.5). Alternativa de segunda opiniao quando a resposta do -Qwen3.5-4B parecer fraca: e maior, mas de familia mais antiga, entao nem sempre ganha. QUANDO USAR: comparacao A/B de qualidade, ou fallback se o 4B estiver ocupado. QUANDO NAO USAR: nada que exija tool calling confiavel ou laco agentico - para isso use o -Coder. LIMITE: janela de 8.192 tokens e TRUNCAMENTO SILENCIOSO acima disso (roda via Ollama). Servido pelo gateway.

Qwen2.5-7B-Instruct · 7B · contexto 8.192

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-Qwen2.5-3B

tranquilo agoramangaba-nordeste

Mangaba-Qwen2.5-3B - o menor denso da casa depois do Flash. QUANDO USAR: tarefa curta e barata em que o -LFM2.5-1.2B erra por ser pequeno demais. QUANDO NAO USAR: como padrao - o -Qwen3.5-4B e de geracao mais nova e costuma responder melhor pelo mesmo custo. ATENCAO: tende a responder em ingles sem instrucao explicita de idioma. LIMITE: 8.192 tokens, com truncamento silencioso acima disso (Ollama). Servido pelo gateway.

Qwen2.5-3B-Instruct · 3B · contexto 8.192

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-Muse-Glimmer-30B

tranquilo agoramangaba-nordeste

Muse Glimmer 30B - CABE 18GB, ~12 tok/s

Muse-Glimmer-30B · 30B · contexto 131.072

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir · também: Muse-Glimmer-30B

Mangaba-Ling-Flash

tranquilo agoramangaba-nordeste

Ling Flash 124B CABE 62GB

Ling Flash 124B · 124B · contexto 262.144

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir · também: Ling-Flash

Mangaba-Ling-Tiny

tranquilo agoramangaba-nordeste

Ling Tiny CABE 4.5GB Ideal CPU

Ling Tiny 7.9B · 7.9B · contexto 262.144

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir · também: Ling-tiny

Mangaba-Nemotron-Nano

tranquilo agoramangaba-nordeste

Nemotron Nano 30B CABE 16GB Recomendado

Nemotron Nano 30B · 30B · contexto 1.048.576

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir · também: Nemotron-Nano

Mangaba-Nemotron-Super

tranquilo agoramangaba-nordeste

Nemotron Super 120B CABE 60GB limite

Nemotron Super 120B · 120B · contexto 1.048.576

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir · também: Nemotron-Super

Mangaba-fgemma-270m

tranquilo agorakleos

O menor e mais rápido da base: classificação, extração de campo e respostas curtas em alto volume. Não é modelo de conversa longa.

Gemma 3 270M (Google), denso

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-gpt-oss-20b

tranquilo agorakleos

Agente com raciocínio e tool calling. Pensa antes de responder, então precisa de max_tokens generoso — com orçamento curto o texto visível volta vazio.

gpt-oss-20b (OpenAI, Apache 2.0), MoE

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-ministral-14b

tranquilo agorakleos

Meio-termo entre velocidade e qualidade para texto em português. Serve para resumo, reescrita e respostas de suporte.

Família Mistral (o gateway não informa a variante exata)

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-mistral-small-24b

tranquilo agorakleos

O mais capaz do Kleos para redação e análise mais longa; em troca, o mais lento dos modelos daquele provedor.

Mistral Small 24B, denso

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-qwen3-0.6b

tranquilo agorakleos

O menor Qwen da base: roteamento de mensagens e classificação binária em volume altíssimo. Para qualquer texto que uma pessoa vá ler, use um modelo maior.

Qwen3 0.6B, denso

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-qwen3-1.7b

tranquilo agorakleos

Raciocínio em modelo pequeno: rápido, mas gasta parte do orçamento pensando antes de escrever. Use max_tokens alto.

Qwen3 1.7B, denso

Geração
sem amostras
1º token
sem amostras
Amostras
0

ainda sem chamadas suficientes para medir

Mangaba-qwen3-coder-30b

tranquilo agorakleos

Especialista em programação e tool calling. Servido por mais de um provedor — fixe com kleos/ ou poc/ para escolher qual.

Qwen3-Coder-30B-A3B (MoE, ~3,3B ativos)

Geração
31.7 tok/s
1º token
0.3s
Amostras
3

medido no tráfego real

Mangaba-voz-ptbr

tranquilo agorakleos

Texto vira fala em português brasileiro, pela rota /v1/audio/speech. Vozes Kokoro: pf_dora, pm_alex e pm_santa (campo voice). Devolve WAV.

Kokoro TTS

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-audio-whisper

tranquilo agorakleos

Transcrição de áudio (Whisper), pela rota /v1/audio/transcriptions. Atenção: hoje o servidor devolve o texto traduzido para o inglês (modo translate) — em correção.

Whisper (o gateway não informa a variante)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-qwen3-30b

tranquilo agorapoc

Melhor em portugues do catalogo. Base: Qwen3-30B-A3B-Instruct-2507 (Alibaba, Apache 2.0), MoE de 30B totais e 3B ativos, Q4_K_M. Contexto nativo de 262k tokens. ~33 tok/s.

o gateway não informa a base

Geração
30.1 tok/s
1º token
0.3s
Amostras
3

medido no tráfego real

Mangaba-gpt-oss-120b

tranquilo agorapoc

Agente principal. Base: gpt-oss-120b (OpenAI, Apache 2.0), MoE de 117B parametros totais e 5,1B ativos, quantizacao MXFP4 nativa. Tool calling forte e raciocinio ajustavel. ~20 tok/s nesta maquina.

o gateway não informa a base

Geração
13.8 tok/s
1º token
0.4s
Amostras
3

medido no tráfego real

Mangaba-granite-4-small

tranquilo agorapoc

Opcao de licenca comercial livre. Base: Granite 4.0 H Small (IBM, Apache 2.0), MoE hibrido Mamba de 32B totais e 9B ativos, Q4_K_M. Treinado com foco em function calling. ~11 tok/s — mais lento porque tem mais parametros ativos.

o gateway não informa a base

Geração
12.2 tok/s
1º token
1.2s
Amostras
6

medido no tráfego real

Mangaba-embed

tranquilo agorapoc

Vetores para busca semântica e RAG, pela rota /v1/embeddings. Não conversa: transforma texto em números para comparar significado. 1024 dimensões.

Modelo de embeddings, 1024 dimensões (o gateway não informa a base)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-rerank

tranquilo agorapoc

Reordena resultados de busca por relevância à pergunta, pela rota /v1/rerank. Usado depois do embedding, para pôr no topo o trecho que de fato responde.

Reranker de busca (o gateway não informa a base)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-audio

tranquilo agorapoc

Transcrição de áudio para texto, pela rota /v1/audio/transcriptions. Não atende chat.

Transcrição de fala (o gateway não informa a base)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-audio-hq

tranquilo agorapoc

Transcrição de áudio em qualidade alta, pela rota /v1/audio/transcriptions — mais precisa e mais lenta que a Mangaba-audio.

STT (o gateway não informa a base)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

Mangaba-voz

tranquilo agorapoc

Texto vira fala, pela rota /v1/audio/speech. Vozes: faber, cadu e jeff (campo voice). Devolve WAV pronto para tocar.

TTS (o gateway não informa a base)

Geração
sem amostras
1º token
sem amostras
Amostras
0

utilitário — não gera texto, usa rota própria

O que o console faz

Uma chave por app

Gere, nomeie e revogue chaves-cliente sem tocar no servidor. A master key nunca sai do backend do console.

Consumo em tempo real

Requisições por minuto, tokens por hora e acumulado — por chave, atualizando sozinho.

Quatro protocolos

OpenAI Chat Completions, Anthropic Messages, OpenAI Responses e MCP no mesmo endpoint.

Cache, limites e fallback

Chamada determinística repetida volta em milissegundos; cada chave tem limite próprio; e o roteador cai para o próximo gateway quando um falha.

Playground embutido

Testa modelo, system prompt e temperatura com streaming antes de escrever a primeira linha de código.

Pronto para plugar

Entre no console, gere uma chave e aponte seu app. Limite padrão de 30 req/min e 60.000 tokens/hora por chave.

Entrar no console