Um roteador para os seus modelos Mangaba
Chaves, limites, consumo e playground num só painel. Seus apps falam OpenAI ou Anthropic sem mudar uma linha — trocando só a URL base.
client = OpenAI(
base_url="https://app.mangaba.ia.br/v1",
api_key="SUA_CHAVE",
)
client.chat.completions.create(
model="Mangaba-Nordeste-Coder",
messages=[{"role": "user", "content": "Olá!"}],
)30 modelos em 3 provedores
Lista consultada agora em mangaba-nordeste, kleos, poc. Tudo em CPU, sem GPU. As velocidades são a mediana das chamadas reais que passaram pelo roteador nos últimos 30 dias — não número de folheto.
Mangaba-Qwen3-Coder-30B-A3B
tranquilo agoramangaba-nordesteMangaba-Nordeste-30B - APELIDO LEGADO de Mangaba-Nordeste-Coder: desde 18/ago/2026 os dois nomes atendem no MESMO backend (127.0.0.1:8003), rodando Qwen3-Coder-30B-A3B-Instruct-Q4_K_M. Mantido para nao quebrar clientes antigos; em codigo novo prefira Mangaba-Nordeste-Coder. MoE de 30B totais com ~3,3B ativos por token: qualidade de modelo grande com latencia de modelo pequeno. Otimizado para portugues do Brasil, com foco agentico. QUANDO USAR: e o modelo PADRAO da casa - codigo, laco de agente com ferramentas, tarefas multi-turno, qualquer coisa que exija tool calling confiavel. Nome de modelo desconhecido cai aqui. QUANDO NAO USAR: classificacao ou roteamento de uma linha (o -LFM2.5-1.2B faz o mesmo mais barato) e leitura de imagem (use o -Qwen2.5-VL-7B). POR QUE E RAPIDO: MoE ativa so ~3,3B dos 30B por token, entao lê ~1,9 GB de peso por token em vez dos 17 GB do arquivo - em CPU o que pesa e parametro ATIVO, nao total. ACELERACAO: GWD (esqueleto de tool call semeado) + ngram, com 63-77%% de tokens especulados na 1a tool call. LIMITE: 65.536 tokens por requisicao; acima disso o backend retorna 400 (erro explicito, sem truncar em silencio). Servido pelo gateway. 23,2 tok/s geracao - 54,6 tok/s prompt - 20,5 tok/s tool call.
Qwen3-Coder-30B-A3B-Instruct · 30B totais · 3.3B ativos · contexto 65.536
- Geração
- 20.1 tok/s
- 1º token
- 0.4s
- Amostras
- 6
medido no tráfego real · também: Mangaba-Nordeste-Coder, Mangaba-Nordeste-30B
Mangaba-Qwen3.5-4B
tranquilo agoramangaba-nordesteMangaba-Nordeste-4B - denso compacto (Qwen3.5) para respostas ageis em CPU. QUANDO USAR: perguntas curtas, reformulacao de texto, extracao simples, respostas de baixo custo com tool calling disponivel. E o meio-termo entre o -LFM2.5-1.2B (mais rapido, menos capaz) e o -Coder (mais capaz, MoE). QUANDO NAO USAR: laco agentico longo ou geracao de codigo - use o -Coder, que apesar de ser 30B e MAIS RAPIDO que este por ser MoE. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. 10,0 tok/s geracao - 15,1 tok/s prompt - 10,3 tok/s tool call.
Qwen3.5-4B · 4B · contexto 65.536
- Geração
- 10.6 tok/s
- 1º token
- 0.7s
- Amostras
- 3
medido no tráfego real · também: Mangaba-Nordeste-4B
Mangaba-GLM4.5-Air-106B
tranquilo agoramangaba-nordesteMangaba-Nordeste-Air - GLM-4.5-Air 106B MoE (12B ativos), o de maior capacidade de raciocinio da casa. QUANDO USAR: problema que exige varios passos de raciocinio encadeado, analise longa, decisao dificil - casos em que a qualidade vale esperar. QUANDO NAO USAR: qualquer coisa trivial. E o MAIS LENTO por larga margem: uma tarefa que o -LFM2.5-1.2B resolve em ~6 s leva ~42 s aqui, e o resultado costuma ser o mesmo em tarefa simples. POR QUE E LENTO: le ~7,1 GB de peso por token (contra 1,9 GB do -Coder); o decode em CPU e limitado por banda de memoria, entao isso e um teto fisico, nao falta de ajuste. ACELERACAO: MTP nativo (camada NextN do GLM-4.5) + ngram. Migrado de Q4 para Q3 em 30/ago/2026: +19%% de geracao e +53%% em tool call. AQUECIMENTO: a 1a chamada apos ociosidade rende ~2,0 tok/s e as seguintes ~3,8 - descarte a primeira ao medir. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. ~5,6 tok/s geracao - 6,9 tok/s prompt - 4,3 tok/s tool call.
GLM-4.5-Air · 106B · contexto 65.536
- Geração
- 4.4 tok/s
- 1º token
- 1.5s
- Amostras
- 3
medido no tráfego real · também: Mangaba-Nordeste-Air
Mangaba-Qwen2.5-VL-7B
tranquilo agoramangaba-nordesteMangaba-Nordeste-Vision - Qwen2.5-VL 7B, o unico modelo da casa que LE IMAGEM. QUANDO USAR: OCR, leitura de nota fiscal ou documento, descricao de foto, interpretacao de grafico ou print de tela. COMO CHAMAR: `content` vira uma LISTA com um item `text` e um item `image_url` - a url aceita data URI base64 (`data:image/png;base64,...`) ou http. QUANDO NAO USAR: conversa sem imagem (qualquer outro modelo e melhor) e fluxo com ferramentas - NAO faz tool calling. COLD START DE ~49 s: o Ollama descarrega o modelo apos inatividade; a 1a chamada depois de um periodo parado demora quase um minuto e as seguintes ~1,3 s. Se houver usuario esperando, aqueca com uma chamada trivial antes. ATENCAO - TRUNCA EM SILENCIO: janela de 8.192 tokens, e prompt maior NAO da erro; volta 200 com o excesso descartado. Medido: 40.000 tokens enviados viraram `prompt_tokens: 4098`. Confira `usage.prompt_tokens` contra o que voce mandou. Servido pelo gateway. 1,3 s por imagem (quente) - sem tool call.
Qwen2.5-VL-7B-Instruct · 7B · contexto 8.192
- Geração
- 5.2 tok/s
- 1º token
- 1s
- Amostras
- 3
medido no tráfego real · também: Mangaba-Nordeste-Vision
Mangaba-BGE-M3-568M
tranquilo agoramangaba-nordesteMangaba-Nordeste-Embed - BGE-M3 multilingue, o unico modelo de EMBEDDINGS da casa. QUANDO USAR: busca semantica, RAG, deduplicacao, agrupamento por similaridade. COMO CHAMAR: `POST /v1/embeddings` (NAO /v1/chat/completions - este modelo nao conversa e nao gera texto). O campo `input` aceita uma string ou uma lista de strings; mandar em lote e bem mais eficiente que uma chamada por texto. SAIDA: vetores de 1024 dimensoes, um por texto de entrada, na mesma ordem. ATENCAO - TRUNCA EM SILENCIO acima de 8.192 tokens (roda via Ollama): fatie documentos longos em trechos antes de indexar, ou o vetor representara so o comeco do texto. Servido pelo gateway. 10 vetores em 2,45 s - sem geracao.
BAAI/bge-m3 · 568M · contexto 8.192
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria · também: Mangaba-Nordeste-Embed
Mangaba-LFM2.5-1.2B
tranquilo agoramangaba-nordesteMangaba-Nordeste-Flash - LFM2.5 1.2B, o MAIS RAPIDO da casa. QUANDO USAR: classificacao, roteamento de intencao, extracao de um campo, resposta curta, pre-filtro antes de acionar um modelo caro. E ~7x mais rapido que o -GLM4.5-Air-106B na mesma tarefa trivial. QUANDO NAO USAR: raciocinio de varios passos, codigo nao-trivial ou texto longo - o tamanho cobra o preco; tende a divagar e a ignorar instrucoes de formato rigidas. LIMITE: 32.768 tokens. Servido pelo gateway. 24,9 tok/s geracao - 63,7 tok/s prompt - 25,0 tok/s tool call.
LFM2.5-1.2B · 1.2B · contexto 32.768
- Geração
- 63 tok/s
- 1º token
- 0.3s
- Amostras
- 3
medido no tráfego real · também: Mangaba-Nordeste-Flash
Mangaba-Qwen2.5-7B
tranquilo agoramangaba-nordesteMangaba-Qwen2.5-7B - denso de 7B, geracao anterior (Qwen2.5). Alternativa de segunda opiniao quando a resposta do -Qwen3.5-4B parecer fraca: e maior, mas de familia mais antiga, entao nem sempre ganha. QUANDO USAR: comparacao A/B de qualidade, ou fallback se o 4B estiver ocupado. QUANDO NAO USAR: nada que exija tool calling confiavel ou laco agentico - para isso use o -Coder. LIMITE: janela de 8.192 tokens e TRUNCAMENTO SILENCIOSO acima disso (roda via Ollama). Servido pelo gateway.
Qwen2.5-7B-Instruct · 7B · contexto 8.192
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-Qwen2.5-3B
tranquilo agoramangaba-nordesteMangaba-Qwen2.5-3B - o menor denso da casa depois do Flash. QUANDO USAR: tarefa curta e barata em que o -LFM2.5-1.2B erra por ser pequeno demais. QUANDO NAO USAR: como padrao - o -Qwen3.5-4B e de geracao mais nova e costuma responder melhor pelo mesmo custo. ATENCAO: tende a responder em ingles sem instrucao explicita de idioma. LIMITE: 8.192 tokens, com truncamento silencioso acima disso (Ollama). Servido pelo gateway.
Qwen2.5-3B-Instruct · 3B · contexto 8.192
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-Muse-Glimmer-30B
tranquilo agoramangaba-nordesteMuse Glimmer 30B - CABE 18GB, ~12 tok/s
Muse-Glimmer-30B · 30B · contexto 131.072
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir · também: Muse-Glimmer-30B
Mangaba-Ling-Flash
tranquilo agoramangaba-nordesteLing Flash 124B CABE 62GB
Ling Flash 124B · 124B · contexto 262.144
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir · também: Ling-Flash
Mangaba-Ling-Tiny
tranquilo agoramangaba-nordesteLing Tiny CABE 4.5GB Ideal CPU
Ling Tiny 7.9B · 7.9B · contexto 262.144
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir · também: Ling-tiny
Mangaba-Nemotron-Nano
tranquilo agoramangaba-nordesteNemotron Nano 30B CABE 16GB Recomendado
Nemotron Nano 30B · 30B · contexto 1.048.576
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir · também: Nemotron-Nano
Mangaba-Nemotron-Super
tranquilo agoramangaba-nordesteNemotron Super 120B CABE 60GB limite
Nemotron Super 120B · 120B · contexto 1.048.576
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir · também: Nemotron-Super
Mangaba-fgemma-270m
tranquilo agorakleosO menor e mais rápido da base: classificação, extração de campo e respostas curtas em alto volume. Não é modelo de conversa longa.
Gemma 3 270M (Google), denso
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-gpt-oss-20b
tranquilo agorakleosAgente com raciocínio e tool calling. Pensa antes de responder, então precisa de max_tokens generoso — com orçamento curto o texto visível volta vazio.
gpt-oss-20b (OpenAI, Apache 2.0), MoE
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-ministral-14b
tranquilo agorakleosMeio-termo entre velocidade e qualidade para texto em português. Serve para resumo, reescrita e respostas de suporte.
Família Mistral (o gateway não informa a variante exata)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-mistral-small-24b
tranquilo agorakleosO mais capaz do Kleos para redação e análise mais longa; em troca, o mais lento dos modelos daquele provedor.
Mistral Small 24B, denso
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-qwen3-0.6b
tranquilo agorakleosO menor Qwen da base: roteamento de mensagens e classificação binária em volume altíssimo. Para qualquer texto que uma pessoa vá ler, use um modelo maior.
Qwen3 0.6B, denso
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-qwen3-1.7b
tranquilo agorakleosRaciocínio em modelo pequeno: rápido, mas gasta parte do orçamento pensando antes de escrever. Use max_tokens alto.
Qwen3 1.7B, denso
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
ainda sem chamadas suficientes para medir
Mangaba-qwen3-coder-30b
tranquilo agorakleosEspecialista em programação e tool calling. Servido por mais de um provedor — fixe com kleos/ ou poc/ para escolher qual.
Qwen3-Coder-30B-A3B (MoE, ~3,3B ativos)
- Geração
- 31.7 tok/s
- 1º token
- 0.3s
- Amostras
- 3
medido no tráfego real
Mangaba-voz-ptbr
tranquilo agorakleosTexto vira fala em português brasileiro, pela rota /v1/audio/speech. Vozes Kokoro: pf_dora, pm_alex e pm_santa (campo voice). Devolve WAV.
Kokoro TTS
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-audio-whisper
tranquilo agorakleosTranscrição de áudio (Whisper), pela rota /v1/audio/transcriptions. Atenção: hoje o servidor devolve o texto traduzido para o inglês (modo translate) — em correção.
Whisper (o gateway não informa a variante)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-qwen3-30b
tranquilo agorapocMelhor em portugues do catalogo. Base: Qwen3-30B-A3B-Instruct-2507 (Alibaba, Apache 2.0), MoE de 30B totais e 3B ativos, Q4_K_M. Contexto nativo de 262k tokens. ~33 tok/s.
o gateway não informa a base
- Geração
- 30.1 tok/s
- 1º token
- 0.3s
- Amostras
- 3
medido no tráfego real
Mangaba-gpt-oss-120b
tranquilo agorapocAgente principal. Base: gpt-oss-120b (OpenAI, Apache 2.0), MoE de 117B parametros totais e 5,1B ativos, quantizacao MXFP4 nativa. Tool calling forte e raciocinio ajustavel. ~20 tok/s nesta maquina.
o gateway não informa a base
- Geração
- 13.8 tok/s
- 1º token
- 0.4s
- Amostras
- 3
medido no tráfego real
Mangaba-granite-4-small
tranquilo agorapocOpcao de licenca comercial livre. Base: Granite 4.0 H Small (IBM, Apache 2.0), MoE hibrido Mamba de 32B totais e 9B ativos, Q4_K_M. Treinado com foco em function calling. ~11 tok/s — mais lento porque tem mais parametros ativos.
o gateway não informa a base
- Geração
- 12.2 tok/s
- 1º token
- 1.2s
- Amostras
- 6
medido no tráfego real
Mangaba-embed
tranquilo agorapocVetores para busca semântica e RAG, pela rota /v1/embeddings. Não conversa: transforma texto em números para comparar significado. 1024 dimensões.
Modelo de embeddings, 1024 dimensões (o gateway não informa a base)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-rerank
tranquilo agorapocReordena resultados de busca por relevância à pergunta, pela rota /v1/rerank. Usado depois do embedding, para pôr no topo o trecho que de fato responde.
Reranker de busca (o gateway não informa a base)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-audio
tranquilo agorapocTranscrição de áudio para texto, pela rota /v1/audio/transcriptions. Não atende chat.
Transcrição de fala (o gateway não informa a base)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-audio-hq
tranquilo agorapocTranscrição de áudio em qualidade alta, pela rota /v1/audio/transcriptions — mais precisa e mais lenta que a Mangaba-audio.
STT (o gateway não informa a base)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
Mangaba-voz
tranquilo agorapocTexto vira fala, pela rota /v1/audio/speech. Vozes: faber, cadu e jeff (campo voice). Devolve WAV pronto para tocar.
TTS (o gateway não informa a base)
- Geração
- sem amostras
- 1º token
- sem amostras
- Amostras
- 0
utilitário — não gera texto, usa rota própria
O que o console faz
Uma chave por app
Gere, nomeie e revogue chaves-cliente sem tocar no servidor. A master key nunca sai do backend do console.
Consumo em tempo real
Requisições por minuto, tokens por hora e acumulado — por chave, atualizando sozinho.
Quatro protocolos
OpenAI Chat Completions, Anthropic Messages, OpenAI Responses e MCP no mesmo endpoint.
Cache, limites e fallback
Chamada determinística repetida volta em milissegundos; cada chave tem limite próprio; e o roteador cai para o próximo gateway quando um falha.
Playground embutido
Testa modelo, system prompt e temperatura com streaming antes de escrever a primeira linha de código.
Pronto para plugar
Entre no console, gere uma chave e aponte seu app. Limite padrão de 30 req/min e 60.000 tokens/hora por chave.
Entrar no console