Modelos
Inferência própria, em CPU, sem GPU. As velocidades são as medidas no gateway com ~7,2k tokens de prompt e 150 de saída; o custo é o equivalente — quanto a mesma chamada custaria num provedor comercial de porte parecido.
| Modelo | Provedor | Base | Contexto | 1º token | Geração | Tool call | Equivalente (US$/1M) |
|---|---|---|---|---|---|---|---|
Mangaba-Qwen3-Coder-30B-A3B Mangaba-Nordeste-30B - APELIDO LEGADO de Mangaba-Nordeste-Coder: desde 18/ago/2026 os dois nomes atendem no MESMO backend (127.0.0.1:8003), rodando Qwen3-Coder-30B-A3B-Instruct-Q4_K_M. Mantido para nao quebrar clientes antigos; em codigo novo prefira Mangaba-Nordeste-Coder. MoE de 30B totais com ~3,3B ativos por token: qualidade de modelo grande com latencia de modelo pequeno. Otimizado para portugues do Brasil, com foco agentico. QUANDO USAR: e o modelo PADRAO da casa - codigo, laco de agente com ferramentas, tarefas multi-turno, qualquer coisa que exija tool calling confiavel. Nome de modelo desconhecido cai aqui. QUANDO NAO USAR: classificacao ou roteamento de uma linha (o -LFM2.5-1.2B faz o mesmo mais barato) e leitura de imagem (use o -Qwen2.5-VL-7B). POR QUE E RAPIDO: MoE ativa so ~3,3B dos 30B por token, entao lê ~1,9 GB de peso por token em vez dos 17 GB do arquivo - em CPU o que pesa e parametro ATIVO, nao total. ACELERACAO: GWD (esqueleto de tool call semeado) + ngram, com 63-77%% de tokens especulados na 1a tool call. LIMITE: 65.536 tokens por requisicao; acima disso o backend retorna 400 (erro explicito, sem truncar em silencio). Servido pelo gateway. 23,2 tok/s geracao - 54,6 tok/s prompt - 20,5 tok/s tool call. também atende por: Mangaba-Nordeste-Coder, Mangaba-Nordeste-30B chattool callingtool calling streamingmulti turn agent loopstreaming | mangaba-nordeste tranquilo agora | Qwen3-Coder-30B-A3B-Instruct Mixture-of-Experts (MoE) 30B totais · 3.3B ativos Q4_K_M (CPU/llama.cpp) | 65.536 | 0.4s | 20.1 tok/s medido em 6 chamadas | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Qwen3.5-4B Mangaba-Nordeste-4B - denso compacto (Qwen3.5) para respostas ageis em CPU. QUANDO USAR: perguntas curtas, reformulacao de texto, extracao simples, respostas de baixo custo com tool calling disponivel. E o meio-termo entre o -LFM2.5-1.2B (mais rapido, menos capaz) e o -Coder (mais capaz, MoE). QUANDO NAO USAR: laco agentico longo ou geracao de codigo - use o -Coder, que apesar de ser 30B e MAIS RAPIDO que este por ser MoE. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. 10,0 tok/s geracao - 15,1 tok/s prompt - 10,3 tok/s tool call. também atende por: Mangaba-Nordeste-4B chattool callingstreaming | mangaba-nordeste tranquilo agora | Qwen3.5-4B Dense (Qwen3.5) 4B Q4_K_M (CPU/llama.cpp) | 65.536 | 0.7s | 10.6 tok/s medido em 3 chamadas | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-GLM4.5-Air-106B Mangaba-Nordeste-Air - GLM-4.5-Air 106B MoE (12B ativos), o de maior capacidade de raciocinio da casa. QUANDO USAR: problema que exige varios passos de raciocinio encadeado, analise longa, decisao dificil - casos em que a qualidade vale esperar. QUANDO NAO USAR: qualquer coisa trivial. E o MAIS LENTO por larga margem: uma tarefa que o -LFM2.5-1.2B resolve em ~6 s leva ~42 s aqui, e o resultado costuma ser o mesmo em tarefa simples. POR QUE E LENTO: le ~7,1 GB de peso por token (contra 1,9 GB do -Coder); o decode em CPU e limitado por banda de memoria, entao isso e um teto fisico, nao falta de ajuste. ACELERACAO: MTP nativo (camada NextN do GLM-4.5) + ngram. Migrado de Q4 para Q3 em 30/ago/2026: +19%% de geracao e +53%% em tool call. AQUECIMENTO: a 1a chamada apos ociosidade rende ~2,0 tok/s e as seguintes ~3,8 - descarte a primeira ao medir. LIMITE: 65.536 tokens; acima disso, 400. Servido pelo gateway. ~5,6 tok/s geracao - 6,9 tok/s prompt - 4,3 tok/s tool call. também atende por: Mangaba-Nordeste-Air chattool callingstreamingreasoning | mangaba-nordeste tranquilo agora | GLM-4.5-Air MoE (GLM-4.5-Air, 106B total / 12B ativos) 106B UD-Q3_K_XL (CPU/llama.cpp) | 65.536 | 1.5s | 4.4 tok/s medido em 3 chamadas | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Qwen2.5-VL-7B Mangaba-Nordeste-Vision - Qwen2.5-VL 7B, o unico modelo da casa que LE IMAGEM. QUANDO USAR: OCR, leitura de nota fiscal ou documento, descricao de foto, interpretacao de grafico ou print de tela. COMO CHAMAR: `content` vira uma LISTA com um item `text` e um item `image_url` - a url aceita data URI base64 (`data:image/png;base64,...`) ou http. QUANDO NAO USAR: conversa sem imagem (qualquer outro modelo e melhor) e fluxo com ferramentas - NAO faz tool calling. COLD START DE ~49 s: o Ollama descarrega o modelo apos inatividade; a 1a chamada depois de um periodo parado demora quase um minuto e as seguintes ~1,3 s. Se houver usuario esperando, aqueca com uma chamada trivial antes. ATENCAO - TRUNCA EM SILENCIO: janela de 8.192 tokens, e prompt maior NAO da erro; volta 200 com o excesso descartado. Medido: 40.000 tokens enviados viraram `prompt_tokens: 4098`. Confira `usage.prompt_tokens` contra o que voce mandou. Servido pelo gateway. 1,3 s por imagem (quente) - sem tool call. também atende por: Mangaba-Nordeste-Vision chatstreamingvision | mangaba-nordeste tranquilo agora | Qwen2.5-VL-7B-Instruct Dense multimodal (Qwen2.5-VL) 7B Q4_K_M (CPU/Ollama) | 8.192 | 1s | 5.2 tok/s medido em 3 chamadas | não | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-BGE-M3-568M Mangaba-Nordeste-Embed - BGE-M3 multilingue, o unico modelo de EMBEDDINGS da casa. QUANDO USAR: busca semantica, RAG, deduplicacao, agrupamento por similaridade. COMO CHAMAR: `POST /v1/embeddings` (NAO /v1/chat/completions - este modelo nao conversa e nao gera texto). O campo `input` aceita uma string ou uma lista de strings; mandar em lote e bem mais eficiente que uma chamada por texto. SAIDA: vetores de 1024 dimensoes, um por texto de entrada, na mesma ordem. ATENCAO - TRUNCA EM SILENCIO acima de 8.192 tokens (roda via Ollama): fatie documentos longos em trechos antes de indexar, ou o vetor representara so o comeco do texto. Servido pelo gateway. 10 vetores em 2,45 s - sem geracao. também atende por: Mangaba-Nordeste-Embed embeddings | mangaba-nordeste tranquilo agora | BAAI/bge-m3 Encoder (BGE-M3) 568M | 8.192 | sem amostras | não se aplica | não | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-LFM2.5-1.2B Mangaba-Nordeste-Flash - LFM2.5 1.2B, o MAIS RAPIDO da casa. QUANDO USAR: classificacao, roteamento de intencao, extracao de um campo, resposta curta, pre-filtro antes de acionar um modelo caro. E ~7x mais rapido que o -GLM4.5-Air-106B na mesma tarefa trivial. QUANDO NAO USAR: raciocinio de varios passos, codigo nao-trivial ou texto longo - o tamanho cobra o preco; tende a divagar e a ignorar instrucoes de formato rigidas. LIMITE: 32.768 tokens. Servido pelo gateway. 24,9 tok/s geracao - 63,7 tok/s prompt - 25,0 tok/s tool call. também atende por: Mangaba-Nordeste-Flash chattool callingstreaming | mangaba-nordeste tranquilo agora | LFM2.5-1.2B Dense (LFM2.5) 1.2B GGUF (CPU/llama.cpp) | 32.768 | 0.3s | 63 tok/s medido em 3 chamadas | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Qwen2.5-7B Mangaba-Qwen2.5-7B - denso de 7B, geracao anterior (Qwen2.5). Alternativa de segunda opiniao quando a resposta do -Qwen3.5-4B parecer fraca: e maior, mas de familia mais antiga, entao nem sempre ganha. QUANDO USAR: comparacao A/B de qualidade, ou fallback se o 4B estiver ocupado. QUANDO NAO USAR: nada que exija tool calling confiavel ou laco agentico - para isso use o -Coder. LIMITE: janela de 8.192 tokens e TRUNCAMENTO SILENCIOSO acima disso (roda via Ollama). Servido pelo gateway. chatstreaming | mangaba-nordeste tranquilo agora | Qwen2.5-7B-Instruct Dense (Qwen2.5) 7B Q4_K_M (CPU/Ollama) | 8.192 | sem amostras | sem amostras ainda | não | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Qwen2.5-3B Mangaba-Qwen2.5-3B - o menor denso da casa depois do Flash. QUANDO USAR: tarefa curta e barata em que o -LFM2.5-1.2B erra por ser pequeno demais. QUANDO NAO USAR: como padrao - o -Qwen3.5-4B e de geracao mais nova e costuma responder melhor pelo mesmo custo. ATENCAO: tende a responder em ingles sem instrucao explicita de idioma. LIMITE: 8.192 tokens, com truncamento silencioso acima disso (Ollama). Servido pelo gateway. chatstreaming | mangaba-nordeste tranquilo agora | Qwen2.5-3B-Instruct Dense (Qwen2.5) 3B Q4_K_M (CPU/Ollama) | 8.192 | sem amostras | sem amostras ainda | não | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Muse-Glimmer-30B Muse Glimmer 30B - CABE 18GB, ~12 tok/s também atende por: Muse-Glimmer-30B chattool callingtool calling streamingstreaming | mangaba-nordeste tranquilo agora | Muse-Glimmer-30B Dense 30B Q4_K_M | 131.072 | sem amostras | sem amostras ainda | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Ling-Flash Ling Flash 124B CABE 62GB também atende por: Ling-Flash chattool callingtool calling streamingstreaming | mangaba-nordeste tranquilo agora | Ling Flash 124B MoE 124B Q4 | 262.144 | sem amostras | sem amostras ainda | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Ling-Tiny Ling Tiny CABE 4.5GB Ideal CPU também atende por: Ling-tiny chattool callingtool calling streamingstreaming | mangaba-nordeste tranquilo agora | Ling Tiny 7.9B MoE 7.9B Q4 | 262.144 | sem amostras | sem amostras ainda | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Nemotron-Nano Nemotron Nano 30B CABE 16GB Recomendado também atende por: Nemotron-Nano chattool callingtool calling streamingstreaming | mangaba-nordeste tranquilo agora | Nemotron Nano 30B MoE 30B Q4 | 1.048.576 | sem amostras | sem amostras ainda | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-Nemotron-Super Nemotron Super 120B CABE 60GB limite também atende por: Nemotron-Super chattool callingtool calling streamingstreaming | mangaba-nordeste tranquilo agora | Nemotron Super 120B MoE 120B Q4 | 1.048.576 | sem amostras | sem amostras ainda | sim | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-fgemma-270m O menor e mais rápido da base: classificação, extração de campo e respostas curtas em alto volume. Não é modelo de conversa longa. | kleos tranquilo agora | Gemma 3 270M (Google), denso | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-gpt-oss-20b Agente com raciocínio e tool calling. Pensa antes de responder, então precisa de max_tokens generoso — com orçamento curto o texto visível volta vazio. | kleos tranquilo agora | gpt-oss-20b (OpenAI, Apache 2.0), MoE | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-ministral-14b Meio-termo entre velocidade e qualidade para texto em português. Serve para resumo, reescrita e respostas de suporte. | kleos tranquilo agora | Família Mistral (o gateway não informa a variante exata) | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-mistral-small-24b O mais capaz do Kleos para redação e análise mais longa; em troca, o mais lento dos modelos daquele provedor. | kleos tranquilo agora | Mistral Small 24B, denso | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-qwen3-0.6b O menor Qwen da base: roteamento de mensagens e classificação binária em volume altíssimo. Para qualquer texto que uma pessoa vá ler, use um modelo maior. | kleos tranquilo agora | Qwen3 0.6B, denso | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-qwen3-1.7b Raciocínio em modelo pequeno: rápido, mas gasta parte do orçamento pensando antes de escrever. Use max_tokens alto. | kleos tranquilo agora | Qwen3 1.7B, denso | não informado | sem amostras | sem amostras ainda | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-qwen3-coder-30b Especialista em programação e tool calling. Servido por mais de um provedor — fixe com kleos/ ou poc/ para escolher qual. | kleos tranquilo agora | Qwen3-Coder-30B-A3B (MoE, ~3,3B ativos) | não informado | 0.3s | 31.7 tok/s medido em 3 chamadas | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-voz-ptbr Texto vira fala em português brasileiro, pela rota /v1/audio/speech. Vozes Kokoro: pf_dora, pm_alex e pm_santa (campo voice). Devolve WAV. | kleos tranquilo agora | Kokoro TTS | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-audio-whisper Transcrição de áudio (Whisper), pela rota /v1/audio/transcriptions. Atenção: hoje o servidor devolve o texto traduzido para o inglês (modo translate) — em correção. | kleos tranquilo agora | Whisper (o gateway não informa a variante) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-qwen3-30b Melhor em portugues do catalogo. Base: Qwen3-30B-A3B-Instruct-2507 (Alibaba, Apache 2.0), MoE de 30B totais e 3B ativos, Q4_K_M. Contexto nativo de 262k tokens. ~33 tok/s. | poc tranquilo agora | o gateway não informa a base | não informado | 0.3s | 30.1 tok/s medido em 3 chamadas | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-gpt-oss-120b Agente principal. Base: gpt-oss-120b (OpenAI, Apache 2.0), MoE de 117B parametros totais e 5,1B ativos, quantizacao MXFP4 nativa. Tool calling forte e raciocinio ajustavel. ~20 tok/s nesta maquina. | poc tranquilo agora | o gateway não informa a base | não informado | 0.4s | 13.8 tok/s medido em 3 chamadas | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-granite-4-small Opcao de licenca comercial livre. Base: Granite 4.0 H Small (IBM, Apache 2.0), MoE hibrido Mamba de 32B totais e 9B ativos, Q4_K_M. Treinado com foco em function calling. ~11 tok/s — mais lento porque tem mais parametros ativos. | poc tranquilo agora | o gateway não informa a base | não informado | 1.2s | 12.2 tok/s medido em 6 chamadas | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-embed Vetores para busca semântica e RAG, pela rota /v1/embeddings. Não conversa: transforma texto em números para comparar significado. 1024 dimensões. | poc tranquilo agora | Modelo de embeddings, 1024 dimensões (o gateway não informa a base) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-rerank Reordena resultados de busca por relevância à pergunta, pela rota /v1/rerank. Usado depois do embedding, para pôr no topo o trecho que de fato responde. | poc tranquilo agora | Reranker de busca (o gateway não informa a base) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-audio Transcrição de áudio para texto, pela rota /v1/audio/transcriptions. Não atende chat. | poc tranquilo agora | Transcrição de fala (o gateway não informa a base) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-audio-hq Transcrição de áudio em qualidade alta, pela rota /v1/audio/transcriptions — mais precisa e mais lenta que a Mangaba-audio. | poc tranquilo agora | STT (o gateway não informa a base) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Mangaba-voz Texto vira fala, pela rota /v1/audio/speech. Vozes: faber, cadu e jeff (campo voice). Devolve WAV pronto para tocar. | poc tranquilo agora | TTS (o gateway não informa a base) | não informado | sem amostras | não se aplica | não informado | 0.60 entrada · 2.40 saída vs. porte médio |
Uma URL, quatro protocolos
OpenAI Chat Completions, Anthropic Messages, OpenAI Responses e MCP no mesmo endereço — troque a base URL e pronto.
Cache e fallback
Chamadas determinísticas repetidas voltam em milissegundos, e o roteador cai para o próximo gateway quando um falha.
Consumo medido
Cada chamada vira uma linha com latência, tokens e custo equivalente — p95 e tok/s da sua carga, não do folheto.