Ollama é uma ferramenta gratuita e de código aberto para rodar LLMs (grandes modelos de linguagem) no seu próprio computador. Ela funciona no Windows, no macOS e no Linux, e uma única linha, ollama run nome-do-modelo, leva você do download do modelo até a conversa com ele. Enquanto está rodando, ela sobe um servidor de API em localhost:11434, então seus próprios apps e outras ferramentas também podem chamá-la.

Este guia foca em como usar o Ollama em si: o comando de instalação de cada sistema, a lista completa de comandos, o Modelfile, as variáveis de ambiente e exemplos mínimos da API, tudo conferido no repositório oficial no GitHub e na documentação oficial (em 29 de setembro de 2026). Para LLMs locais em geral, veja como começar com um LLM local; para escolher o modelo, o nosso comparativo dos melhores modelos de LLM local; e para ligá-lo ao seu editor, o artigo sobre Ollama + Cline.

LOCAL LLM RUNTIME

Um comando, um LLM local

— Ele cuida de quase toda a parte trabalhosa da configuração

$ ollama pull qwen3
$ ollama run qwen3
>>> Olá! O que você consegue fazer?

✅ Gratuito / OSS

🖥️ Win/Mac/Linux

🔌 API local

⏱️ Configura em minutos

1. O que é o Ollama? O runtime de referência para LLMs locais

O Ollama é uma ferramenta gratuita e de código aberto para rodar LLMs locais com facilidade no seu próprio PC. Ele resolve a parte trabalhosa — baixar modelos, lidar com formatos de quantização, configurar o uso de GPU — nos bastidores, de modo que tudo o que você faz é "indicar um modelo e executá-lo".

💡 Em poucas palavras: o Ollama é o "Docker para LLMs". Baixe um modelo com ollama pull e converse com ollama run. Ele também sobe um servidor de API local, então seus próprios apps e interfaces de chat também podem chamá-lo.

Uma ferramenta parecida é o LM Studio. De forma resumida: Ollama = focado em CLI, para desenvolvedores, APIs e automação; LM Studio = focado em GUI, para quem não é engenheiro e está começando. Ambos são gratuitos e instalam em minutos. Este artigo gira em torno do Ollama (que também cobre APIs e integração); se você quer uma GUI, vá para a Seção 5.

2. Como instalar o Ollama (Windows / macOS / Linux)

A página oficial de download e o README do GitHub oferecem dois caminhos para cada sistema: um comando de uma linha para colar no terminal ou um instalador manual. Qualquer um dos dois leva ao mesmo resultado.

Windows

Abra o PowerShell e execute esta linha (exatamente como na página oficial):

irm https://ollama.com/install.ps1 | iex

Se preferir não usar comandos, clique em "Download for Windows" na página de download e execute o OllamaSetup.exe. Segundo a página oficial do Windows, é preciso ter Windows 10 22H2 ou mais recente (Home ou Pro). Não é preciso ser administrador: por padrão, a instalação vai para a sua pasta de usuário. Só o programa pede pelo menos 4 GB livres, e os modelos podem somar de dezenas a centenas de GB. Depois de instalado, o Ollama fica rodando em segundo plano e o comando ollama funciona tanto no cmd quanto no PowerShell.

macOS

Execute esta linha no Terminal:

curl -fsSL https://ollama.com/install.sh | sh

Para instalar manualmente, abra o Ollama.dmg e arraste o app para a pasta Aplicativos. Na primeira execução, se o comando ollama não estiver no PATH, o app pede permissão para criar um link em /usr/local/bin. É preciso ter macOS 14 Sonoma ou mais recente; Macs com Apple série M usam CPU e GPU, enquanto Macs Intel (x86) rodam só na CPU (página oficial do macOS).

Linux

Uma linha instala tudo. Para atualizar depois, rode o mesmo comando de novo.

curl -fsSL https://ollama.com/install.sh | sh

Os passos de instalação manual sem o script e o pacote extra para GPUs AMD estão na página oficial do Linux.

Docker

A imagem oficial ollama/ollama está no Docker Hub. Esta é a configuração mínima só com CPU (para GPUs NVIDIA, instale o NVIDIA Container Toolkit e acrescente --gpus=all; detalhes na página oficial do Docker):

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
docker exec -it ollama ollama run gemma3:4b

🔌 Confira se funcionou: depois de instalar, abra um terminal novo e digite ollama -v (ou ollama --version). Se aparecer a versão, está pronto. As atualizações são baixadas automaticamente no Windows e no macOS; para aplicá-las, clique no ícone da barra de tarefas ou da barra de menus e escolha "Restart to update". No Linux, rode de novo a linha de instalação (FAQ oficial).

3. Lista de comandos do Ollama

Esta tabela reúne os comandos exibidos pelo ollama --help atual, conferidos com a referência oficial da CLI e com a definição no código-fonte. No dia a dia, você vai usar principalmente os cinco primeiros.

Comando O que faz Exemplo
ollama run MODEL [PROMPT] Inicia um modelo e conversa com ele; baixa antes se preciso; com um PROMPT, responde uma vez e encerra ollama run qwen3
ollama pull MODEL Só baixa o modelo ollama pull gemma3:4b
ollama list Lista os modelos baixados e seus tamanhos (alias: ls) ollama ls
ollama ps Lista os modelos carregados na memória; a coluna PROCESSOR indica GPU ou CPU ollama ps
ollama stop MODEL Tira da memória um modelo em execução ollama stop qwen3
ollama rm MODEL Apaga um modelo para liberar disco (aceita vários) ollama rm gemma3:4b
ollama show MODEL Mostra as informações do modelo; --modelfile e --parameters revelam a configuração ollama show --modelfile qwen3
ollama create MODEL Cria o seu próprio modelo a partir de um Modelfile ollama create my-assistant -f Modelfile
ollama cp SOURCE DESTINATION Copia um modelo com outro nome ollama cp qwen3 my-qwen
ollama push MODEL Envia o seu modelo para um registro (ollama.com) ollama push seu-usuario/my-assistant
ollama serve Inicia o servidor de API (alias: start); no Windows e no macOS, o app em segundo plano faz isso por você ollama serve
ollama signin / signout Entra ou sai da conta no ollama.com (para usar modelos na nuvem) ollama signin
ollama launch [INTEGRATION] Abre uma integração como Claude Code ou Codex usando modelos do Ollama ollama launch claude

Dentro de uma conversa (depois do prompt >>>), há comandos próprios que começam com /. /bye sai, /? lista todos, /clear apaga o contexto da conversa e /set parameter num_ctx 8192 muda o tamanho do contexto na hora. Para digitar várias linhas de uma vez, coloque-as entre """.

4. Como obter e escolher modelos

Especifique um modelo pelo nome + tag de tamanho. Se você omitir a tag, é usada a padrão, latest. Por exemplo, llama3.2 é o mesmo que llama3.2:latest, que é a versão de 3B, llama3.2:3b (a lista oficial de tags mostra que são a mesma versão). Se quiser a versão menor, de 1B, peça llama3.2:1b explicitamente. O tamanho para o qual latest aponta muda de modelo para modelo, então confira a lista de tags antes de baixar. A regra prática: escolha um tamanho que caiba na sua VRAM.

# Testar um modelo leve (para começar, cerca de 3,3 GB)
ollama run gemma3:4b
# Bom para tudo (latest = 8B, cerca de 5,2 GB)
ollama run qwen3
# Para programar (latest = 30B, cerca de 19 GB)
ollama run qwen3-coder

Os tamanhos são os exibidos em cada tag na biblioteca oficial (em 29 de setembro de 2026). Em alguns modelos, como o qwen3-coder, omitir a tag baixa uma versão grande, então, numa máquina com pouco disco ou memória, confira antes a lista de tags. Depois de instalado, ollama show qwen3 mostra o número de parâmetros, a quantização, o tamanho do contexto e mais.

💡 Qual modelo? Decida pelo caso de uso (geral / código / o seu idioma) e pelo tamanho. Para escolhas por linhagem e caso de uso, veja o nosso comparativo dos melhores modelos de LLM local; para a VRAM que cada tamanho exige, veja o artigo sobre requisitos de hardware. Na dúvida, comece pequeno (classe 7B).

5. Usando uma GUI (Open WebUI e outras)

Não curte o terminal? Sem problema — dá para colocar uma tela de chat (GUI) sobre o Ollama.

Open WebUI

Uma popular tela no estilo ChatGPT que você conecta ao seu Ollama local. Suporta histórico de conversas, troca de modelos e múltiplos usuários.

Quer uma GUI desde o início? LM Studio

Um único app que cuida da busca, download e chat de modelos. Ideal para quem não é engenheiro e está começando. No Apple Silicon, pode ser rápido via formato MLX.

6. Usando a API (integrando em apps)

A grande força do Ollama é a sua API local. Por padrão, o servidor escuta em 127.0.0.1:11434, e enviando requisições para lá seus apps, scripts e ferramentas podem usar um LLM local. Há duas portas de entrada principais.

API nativa

POST localhost:11434
 /api/generate
 /api/chat

O formato simples do próprio Ollama, que também aceita opções específicas como keep_alive.

API compatível com OpenAI

POST localhost:11434
 /v1/chat/completions
 /v1/responses

Reaproveite código feito para a OpenAI trocando só o endpoint.

/api/generate (uma única resposta)

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3",
  "prompt": "Why is the sky blue?",
  "stream": false
}'

Se tirar "stream": false, a resposta chega aos poucos, em linhas de JSON (o streaming é o padrão).

/api/chat (enviar o histórico da conversa)

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Esses dois exemplos são para os shells do macOS e do Linux. O PowerShell do Windows trata as aspas de outro jeito, então use este formato da página oficial do Windows:

(Invoke-WebRequest -method POST -Body '{"model":"qwen3", "prompt":"Why is the sky blue?", "stream": false}' -uri http://localhost:11434/api/generate ).Content | ConvertFrom-json

Compatível com OpenAI (/v1)

Com a biblioteca oficial da OpenAI, basta apontar o base_url para o Ollama. Segundo a documentação oficial, a chave de API é "obrigatória, mas ignorada", então qualquer texto serve.

from openai import OpenAI

client = OpenAI(
    base_url='http://localhost:11434/v1/',
    api_key='ollama',  # required but ignored
)

chat_completion = client.chat.completions.create(
    messages=[{'role': 'user', 'content': 'Say this is a test'}],
    model='qwen3',
)
print(chat_completion.choices[0].message.content)

🔌 A compatibilidade com a OpenAI é poderosa: muitas bibliotecas e ferramentas suportam a API da OpenAI. Apontando-as para o endpoint /v1 do Ollama, você passa a usar modelos locais no lugar da nuvem. Também funciona como plano B quando um serviço na nuvem cai. Python e JavaScript têm ainda bibliotecas oficiais (pip install ollama / npm i ollama).

7. Personalizando (Modelfile, variáveis de ambiente)

Modelfile: crie o seu próprio modelo

Um Modelfile é um arquivo de configuração parecido com um Dockerfile. Você parte de um modelo base (FROM, obrigatório), acrescenta parâmetros (PARAMETER) e um prompt de sistema (SYSTEM) e ganha "o seu próprio modelo", que sempre se comporta do mesmo jeito. Um exemplo mínimo:

FROM qwen3
PARAMETER temperature 0.7
PARAMETER num_ctx 8192
SYSTEM """Você é um assistente objetivo. Comece pelo essencial e responda em português."""

Salve-o num arquivo chamado Modelfile e rode isto na mesma pasta:

ollama create my-assistant -f Modelfile
ollama run my-assistant

Para ver o Modelfile de um modelo existente, rode ollama show --modelfile qwen3. Copiar e editar esse arquivo é o jeito mais rápido de começar.

Principais variáveis de ambiente

O comportamento do servidor muda com variáveis de ambiente. ollama serve --help mostra a lista completa. Estas são as mais usadas, com os valores padrão que constam no código-fonte.

Variável O que muda Padrão
OLLAMA_HOST Endereço e porta em que o servidor escuta; com 0.0.0.0:11434 outros aparelhos da rede local podem usá-lo 127.0.0.1:11434
OLLAMA_MODELS Onde os modelos ficam salvos; serve para levá-los a um disco maior macOS ~/.ollama/models, Windows C:\Users\%username%\.ollama\models, Linux /usr/share/ollama/.ollama/models
OLLAMA_KEEP_ALIVE Quanto tempo o modelo fica na memória depois do último uso; -1 mantém carregado 5m (5 minutos)
OLLAMA_CONTEXT_LENGTH O tamanho de contexto padrão Conforme a VRAM (menos de 24 GiB: 4k / 24–48 GiB: 32k / 48 GiB ou mais: 256k)
OLLAMA_NUM_PARALLEL Quantas requisições um mesmo modelo atende ao mesmo tempo 1
OLLAMA_ORIGINS Origens que podem acessá-lo pelo navegador (separadas por vírgula) 127.0.0.1 e 0.0.0.0
OLLAMA_NO_CLOUD Com 1, desliga os recursos de nuvem (inferência remota e busca na web) e fica só no local Desligado

O jeito de definir depende do sistema (FAQ oficial). No Windows, feche o Ollama pela barra de tarefas, crie uma variável de usuário nas configurações de variáveis de ambiente e abra o Ollama de novo pelo menu Iniciar. No macOS, defina com algo como launchctl setenv OLLAMA_HOST "0.0.0.0:11434" e reinicie o app. No Linux (rodando com systemd), faça assim:

systemctl edit ollama.service
# acrescente uma linha por variável abaixo de [Service]
# Environment="OLLAMA_HOST=0.0.0.0:11434"
systemctl daemon-reload
systemctl restart ollama

⚠️ Atenção ao tamanho do contexto: o tamanho de contexto padrão depende da sua VRAM e, abaixo de 24 GiB, é de apenas 4k. Isso não basta para documentos longos nem para agentes de programação, e o modelo esquece o que veio antes sem mostrar erro nenhum. Os sintomas e a correção estão no artigo sobre Ollama + Cline.

8. Solução de problemas

Aqui estão as travadas comuns e suas soluções, logo de cara.

Lento ou travando

Se a coluna PROCESSOR do ollama ps não mostrar "100% GPU", o modelo não cabe na VRAM. Desça um tamanho ou use uma versão mais quantizada.

Travamentos por falta de memória

Conte com pelo menos 8 GB de RAM mesmo para 7B, e cerca de 16 GB para 13B ou mais. Um contexto maior consome ainda mais, então deixe o num_ctx no que você precisa.

API não conecta

Verifique se o servidor (o app ou o ollama serve) está rodando e se nada mais usa a porta 11434. Para conectar de outra máquina, defina OLLAMA_HOST como 0.0.0.0.

Modelo não encontrado

Quase sempre é um erro de digitação no nome ou na tag de tamanho. Confira o nome correto na lista oficial de modelos.

Onde ficam os logs

No Windows, o server.log em %LOCALAPPDATA%\Ollama; no macOS, ~/.ollama/logs; no Linux, rode journalctl -u ollama.

Falta espaço no C:

Mude os modelos para outro disco com OLLAMA_MODELS. A pasta de instalação muda com OllamaSetup.exe /DIR="d:\some\location".

Resumo

O Ollama é o caminho mais rápido para entrar nos LLMs locais. Três pontos-chave:

  • Configure em minutos: instale a partir do site oficial e depois é só ollama run <model>. Pouquíssimos comandos para aprender.
  • Escolha modelos pelo tamanho: fique dentro da sua VRAM. Na dúvida, comece na classe 7B e escolha uma linhagem pelo caso de uso.
  • A API é o valor de verdade: a API compatível com OpenAI em localhost:11434 permite integrá-la aos seus próprios apps e interfaces de chat — e servir de plano B para a nuvem.

Comece digitando ollama run qwen3. A melhor forma de aprender é executá-lo enquanto confere as diferenças em relação à nuvem e como escolher um modelo.

Daí em diante, se você quiser avançar até conectar o modelo ao editor e fazê-lo escrever código, o artigo programando com um LLM local trata da configuração do Cline e do Continue, além do tamanho de contexto que faz o agente quebrar sem nunca exibir um erro.

FAQ

P. O Ollama é gratuito? Posso usá-lo comercialmente?

R. O Ollama em si é gratuito e de código aberto. No entanto, cada modelo que você roda tem a própria licença, e o uso comercial depende do modelo. Verifique os termos de cada modelo antes de usar em produto (veja a seção de licenciamento do nosso comparativo de modelos).

P. Ollama ou LM Studio — qual é melhor?

R. Para comandos, APIs, automação e integração nos seus próprios apps, Ollama; se você quer começar fácil com uma GUI, LM Studio. Ambos são gratuitos, então, na dúvida, instale os dois e compare.

Q. Meus dados são enviados para fora?

A. Enquanto você roda um modelo na sua própria máquina, o processamento fica no seu PC; a FAQ oficial afirma que, localmente, o Ollama não vê seus prompts nem seus dados. Mas o Ollama também oferece modelos hospedados na nuvem, e, se você escolher um deles, sua entrada é processada nos servidores do Ollama (que diz não armazená-la nem usá-la para treino). Para ficar só no local, defina OLLAMA_NO_CLOUD=1.

Q. Como atualizar ou desinstalar?

A. No Windows e no macOS, as atualizações são baixadas sozinhas e aplicadas ao clicar em "Restart to update" no ícone. No Linux, rode de novo a linha de instalação. Para desinstalar no Windows, remova-o pela lista de aplicativos das Configurações; no macOS, apague os itens indicados na página oficial do macOS. Os modelos continuam na pasta .ollama, então apague-a também se não precisar mais deles.

P. Posso usá-lo com código OpenAI existente?

R. Sim. O Ollama expõe uma API compatível com OpenAI em localhost:11434/v1, então, na maioria dos casos, você só muda a URL do endpoint e o nome do modelo. Prático para migrar da nuvem para local, ou como plano B.

P. Que tipo de PC eu preciso?

R. Como referência, ao menos 8 GB de RAM para modelos 7B e 16 GB+ para 13B em diante. Para mais conforto, uma GPU compatível (8 GB+ de VRAM) ou um Mac com bastante memória unificada ajuda. Veja o artigo sobre requisitos de hardware para detalhes.