123SUDODocs
Guias

Modelos locais com Ollama

Conecte instâncias do Ollama para executar modelos de código aberto sem taxas de token.

9xchat se conecta aos tempos de execução do Ollama em execução na sua máquina ou em um servidor remoto na sua rede. Ao consultar um modelo Ollama em execução em sua máquina, os prompts não viajam para APIs de nuvem externas e você nunca consome créditos 9xchat ou paga taxas por token.

As conexões do modelo Ollama estão disponíveis em desktop (Windows, macOS e Linux). Usar seus próprios modelos Ollama não requer assinatura ou créditos 9xchat.

Guia de configuração

1. Instale o Ollama

Baixe e instale o Ollama em ollama.com para o sistema operacional de seu desktop.

2. Puxe um modelo

Abra seu terminal ou prompt de comando e obtenha o modelo desejado:

# General chat models
ollama run llama3.2

# Coding & reasoning models
ollama run deepseek-r1:8b
ollama run qwen2.5-coder:7b

Por padrão, o Ollama atende sua API localmente em http://localhost:11434.

3. Conecte Ollama em 9xchat

  1. Em 9xchat, abra Biblioteca → Modelos.
  2. Selecione Ollama na barra lateral do provedor.
  3. 9xchat verifica automaticamente http://localhost:11434 e lista seus dispositivos instalados modelos.
  4. Se sua instância do Ollama for executada em uma máquina remota ou porta personalizada, insira o URL no campo URL do host.
  5. Habilite os modelos que deseja disponibilizar no compositor do chat.

Capacidades e limitações atuais

  • Conversas de bate-papo: você pode alternar entre modelos de nuvem e modelos Ollama por mensagem em tópicos de bate-papo padrão.

  • Ferramentas e MCP: Os modelos Ollama atualmente não suportam ferramentas de agente 9xchat ou chamada de função do servidor MCP.

  • Espaço de trabalho de código: o fluxo de trabalho de código de vários arquivos agente completo requer nuvem modelos capazes de execução estruturada de ferramentas; bate-papo e explicações de código básico ainda podem ser executados em modelos Ollama.

  • Indexação de conhecimento local:EmConfigurações → Modelos padrão, você pode selecionar Ollama como seu provedor de embeddings para indexar coleções de documentos localmente.

Considerações de privacidade

  • Ao apontar para localhost ou 127.0.0.1, as solicitações de geração ficam inteiramente no seu computador.
  • Se você configurar um URL de host remoto (por exemplo, http://192.168.1.50:11434), as solicitações viajar pela sua rede até esse host de destino.
  • Recursos de nuvem (como pesquisa na web, transcrições do YouTube e áudio na nuvem) entre em contato com serviços externos mesmo que o modelo de chat selecionado seja local.

Solução de problemas

  • Instância não detectada: Confirme se o Ollama está em execução e acessível em http://localhost:11434.
  • Conexões remotas ou Docker: Inicie o Ollama com OLLAMA_ORIGIN="*" para permitir solicitações de origem cruzada de 9xchat.
  • Desempenho: se a geração for lenta, escolha um modelo de parâmetro menor (como llama3.2:3b ou 8b) que cabe confortavelmente na RAM/VRAM do seu sistema.

Nesta página