Índice
- 1. O que é o Ollama? O runtime de referência para LLMs locais
- 2. Como instalar o Ollama (Windows / macOS / Linux)
- 3. Lista de comandos do Ollama
- 4. Como obter e escolher modelos
- 5. Usando uma GUI (Open WebUI e outras)
- 6. Usando a API (integrando em apps)
- 7. Personalizando (Modelfile, variáveis de ambiente)
- 8. Solução de problemas
- Resumo
- FAQ
Ollama é uma ferramenta gratuita e de código aberto para rodar LLMs (grandes modelos de linguagem) no seu próprio computador. Ela funciona no Windows, no macOS e no Linux, e uma única linha, ollama run nome-do-modelo, leva você do download do modelo até a conversa com ele. Enquanto está rodando, ela sobe um servidor de API em localhost:11434, então seus próprios apps e outras ferramentas também podem chamá-la.
Este guia foca em como usar o Ollama em si: o comando de instalação de cada sistema, a lista completa de comandos, o Modelfile, as variáveis de ambiente e exemplos mínimos da API, tudo conferido no repositório oficial no GitHub e na documentação oficial (em 29 de setembro de 2026). Para LLMs locais em geral, veja como começar com um LLM local; para escolher o modelo, o nosso comparativo dos melhores modelos de LLM local; e para ligá-lo ao seu editor, o artigo sobre Ollama + Cline.
Um comando, um LLM local
— Ele cuida de quase toda a parte trabalhosa da configuração
✅ Gratuito / OSS
🖥️ Win/Mac/Linux
🔌 API local
⏱️ Configura em minutos
1. O que é o Ollama? O runtime de referência para LLMs locais
O Ollama é uma ferramenta gratuita e de código aberto para rodar LLMs locais com facilidade no seu próprio PC. Ele resolve a parte trabalhosa — baixar modelos, lidar com formatos de quantização, configurar o uso de GPU — nos bastidores, de modo que tudo o que você faz é "indicar um modelo e executá-lo".
💡 Em poucas palavras: o Ollama é o "Docker para LLMs". Baixe um modelo com ollama pull e converse com ollama run. Ele também sobe um servidor de API local, então seus próprios apps e interfaces de chat também podem chamá-lo.
Uma ferramenta parecida é o LM Studio. De forma resumida: Ollama = focado em CLI, para desenvolvedores, APIs e automação; LM Studio = focado em GUI, para quem não é engenheiro e está começando. Ambos são gratuitos e instalam em minutos. Este artigo gira em torno do Ollama (que também cobre APIs e integração); se você quer uma GUI, vá para a Seção 5.
2. Como instalar o Ollama (Windows / macOS / Linux)
A página oficial de download e o README do GitHub oferecem dois caminhos para cada sistema: um comando de uma linha para colar no terminal ou um instalador manual. Qualquer um dos dois leva ao mesmo resultado.
Windows
Abra o PowerShell e execute esta linha (exatamente como na página oficial):
irm https://ollama.com/install.ps1 | iex
Se preferir não usar comandos, clique em "Download for Windows" na página de download e execute o OllamaSetup.exe. Segundo a página oficial do Windows, é preciso ter Windows 10 22H2 ou mais recente (Home ou Pro). Não é preciso ser administrador: por padrão, a instalação vai para a sua pasta de usuário. Só o programa pede pelo menos 4 GB livres, e os modelos podem somar de dezenas a centenas de GB. Depois de instalado, o Ollama fica rodando em segundo plano e o comando ollama funciona tanto no cmd quanto no PowerShell.
macOS
Execute esta linha no Terminal:
curl -fsSL https://ollama.com/install.sh | sh
Para instalar manualmente, abra o Ollama.dmg e arraste o app para a pasta Aplicativos. Na primeira execução, se o comando ollama não estiver no PATH, o app pede permissão para criar um link em /usr/local/bin. É preciso ter macOS 14 Sonoma ou mais recente; Macs com Apple série M usam CPU e GPU, enquanto Macs Intel (x86) rodam só na CPU (página oficial do macOS).
Linux
Uma linha instala tudo. Para atualizar depois, rode o mesmo comando de novo.
curl -fsSL https://ollama.com/install.sh | sh
Os passos de instalação manual sem o script e o pacote extra para GPUs AMD estão na página oficial do Linux.
Docker
A imagem oficial ollama/ollama está no Docker Hub. Esta é a configuração mínima só com CPU (para GPUs NVIDIA, instale o NVIDIA Container Toolkit e acrescente --gpus=all; detalhes na página oficial do Docker):
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
docker exec -it ollama ollama run gemma3:4b
🔌 Confira se funcionou: depois de instalar, abra um terminal novo e digite ollama -v (ou ollama --version). Se aparecer a versão, está pronto. As atualizações são baixadas automaticamente no Windows e no macOS; para aplicá-las, clique no ícone da barra de tarefas ou da barra de menus e escolha "Restart to update". No Linux, rode de novo a linha de instalação (FAQ oficial).
3. Lista de comandos do Ollama
Esta tabela reúne os comandos exibidos pelo ollama --help atual, conferidos com a referência oficial da CLI e com a definição no código-fonte. No dia a dia, você vai usar principalmente os cinco primeiros.
| Comando | O que faz | Exemplo |
|---|---|---|
ollama run MODEL [PROMPT] |
Inicia um modelo e conversa com ele; baixa antes se preciso; com um PROMPT, responde uma vez e encerra | ollama run qwen3 |
ollama pull MODEL |
Só baixa o modelo | ollama pull gemma3:4b |
ollama list |
Lista os modelos baixados e seus tamanhos (alias: ls) | ollama ls |
ollama ps |
Lista os modelos carregados na memória; a coluna PROCESSOR indica GPU ou CPU | ollama ps |
ollama stop MODEL |
Tira da memória um modelo em execução | ollama stop qwen3 |
ollama rm MODEL |
Apaga um modelo para liberar disco (aceita vários) | ollama rm gemma3:4b |
ollama show MODEL |
Mostra as informações do modelo; --modelfile e --parameters revelam a configuração | ollama show --modelfile qwen3 |
ollama create MODEL |
Cria o seu próprio modelo a partir de um Modelfile | ollama create my-assistant -f Modelfile |
ollama cp SOURCE DESTINATION |
Copia um modelo com outro nome | ollama cp qwen3 my-qwen |
ollama push MODEL |
Envia o seu modelo para um registro (ollama.com) | ollama push seu-usuario/my-assistant |
ollama serve |
Inicia o servidor de API (alias: start); no Windows e no macOS, o app em segundo plano faz isso por você | ollama serve |
ollama signin / signout |
Entra ou sai da conta no ollama.com (para usar modelos na nuvem) | ollama signin |
ollama launch [INTEGRATION] |
Abre uma integração como Claude Code ou Codex usando modelos do Ollama | ollama launch claude |
Dentro de uma conversa (depois do prompt >>>), há comandos próprios que começam com /. /bye sai, /? lista todos, /clear apaga o contexto da conversa e /set parameter num_ctx 8192 muda o tamanho do contexto na hora. Para digitar várias linhas de uma vez, coloque-as entre """.
4. Como obter e escolher modelos
Especifique um modelo pelo nome + tag de tamanho. Se você omitir a tag, é usada a padrão, latest. Por exemplo, llama3.2 é o mesmo que llama3.2:latest, que é a versão de 3B, llama3.2:3b (a lista oficial de tags mostra que são a mesma versão). Se quiser a versão menor, de 1B, peça llama3.2:1b explicitamente. O tamanho para o qual latest aponta muda de modelo para modelo, então confira a lista de tags antes de baixar. A regra prática: escolha um tamanho que caiba na sua VRAM.
Os tamanhos são os exibidos em cada tag na biblioteca oficial (em 29 de setembro de 2026). Em alguns modelos, como o qwen3-coder, omitir a tag baixa uma versão grande, então, numa máquina com pouco disco ou memória, confira antes a lista de tags. Depois de instalado, ollama show qwen3 mostra o número de parâmetros, a quantização, o tamanho do contexto e mais.
💡 Qual modelo? Decida pelo caso de uso (geral / código / o seu idioma) e pelo tamanho. Para escolhas por linhagem e caso de uso, veja o nosso comparativo dos melhores modelos de LLM local; para a VRAM que cada tamanho exige, veja o artigo sobre requisitos de hardware. Na dúvida, comece pequeno (classe 7B).
5. Usando uma GUI (Open WebUI e outras)
Não curte o terminal? Sem problema — dá para colocar uma tela de chat (GUI) sobre o Ollama.
Uma popular tela no estilo ChatGPT que você conecta ao seu Ollama local. Suporta histórico de conversas, troca de modelos e múltiplos usuários.
Quer uma GUI desde o início? LM Studio
Um único app que cuida da busca, download e chat de modelos. Ideal para quem não é engenheiro e está começando. No Apple Silicon, pode ser rápido via formato MLX.
6. Usando a API (integrando em apps)
A grande força do Ollama é a sua API local. Por padrão, o servidor escuta em 127.0.0.1:11434, e enviando requisições para lá seus apps, scripts e ferramentas podem usar um LLM local. Há duas portas de entrada principais.
API nativa
POST localhost:11434
/api/generate
/api/chat
O formato simples do próprio Ollama, que também aceita opções específicas como keep_alive.
API compatível com OpenAI
POST localhost:11434
/v1/chat/completions
/v1/responses
Reaproveite código feito para a OpenAI trocando só o endpoint.
/api/generate (uma única resposta)
curl http://localhost:11434/api/generate -d '{
"model": "qwen3",
"prompt": "Why is the sky blue?",
"stream": false
}'
Se tirar "stream": false, a resposta chega aos poucos, em linhas de JSON (o streaming é o padrão).
/api/chat (enviar o histórico da conversa)
curl http://localhost:11434/api/chat -d '{
"model": "qwen3",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'
Esses dois exemplos são para os shells do macOS e do Linux. O PowerShell do Windows trata as aspas de outro jeito, então use este formato da página oficial do Windows:
(Invoke-WebRequest -method POST -Body '{"model":"qwen3", "prompt":"Why is the sky blue?", "stream": false}' -uri http://localhost:11434/api/generate ).Content | ConvertFrom-json
Compatível com OpenAI (/v1)
Com a biblioteca oficial da OpenAI, basta apontar o base_url para o Ollama. Segundo a documentação oficial, a chave de API é "obrigatória, mas ignorada", então qualquer texto serve.
from openai import OpenAI
client = OpenAI(
base_url='http://localhost:11434/v1/',
api_key='ollama', # required but ignored
)
chat_completion = client.chat.completions.create(
messages=[{'role': 'user', 'content': 'Say this is a test'}],
model='qwen3',
)
print(chat_completion.choices[0].message.content)
🔌 A compatibilidade com a OpenAI é poderosa: muitas bibliotecas e ferramentas suportam a API da OpenAI. Apontando-as para o endpoint /v1 do Ollama, você passa a usar modelos locais no lugar da nuvem. Também funciona como plano B quando um serviço na nuvem cai. Python e JavaScript têm ainda bibliotecas oficiais (pip install ollama / npm i ollama).
7. Personalizando (Modelfile, variáveis de ambiente)
Modelfile: crie o seu próprio modelo
Um Modelfile é um arquivo de configuração parecido com um Dockerfile. Você parte de um modelo base (FROM, obrigatório), acrescenta parâmetros (PARAMETER) e um prompt de sistema (SYSTEM) e ganha "o seu próprio modelo", que sempre se comporta do mesmo jeito. Um exemplo mínimo:
FROM qwen3
PARAMETER temperature 0.7
PARAMETER num_ctx 8192
SYSTEM """Você é um assistente objetivo. Comece pelo essencial e responda em português."""
Salve-o num arquivo chamado Modelfile e rode isto na mesma pasta:
ollama create my-assistant -f Modelfile
ollama run my-assistant
Para ver o Modelfile de um modelo existente, rode ollama show --modelfile qwen3. Copiar e editar esse arquivo é o jeito mais rápido de começar.
Principais variáveis de ambiente
O comportamento do servidor muda com variáveis de ambiente. ollama serve --help mostra a lista completa. Estas são as mais usadas, com os valores padrão que constam no código-fonte.
| Variável | O que muda | Padrão |
|---|---|---|
OLLAMA_HOST |
Endereço e porta em que o servidor escuta; com 0.0.0.0:11434 outros aparelhos da rede local podem usá-lo | 127.0.0.1:11434 |
OLLAMA_MODELS |
Onde os modelos ficam salvos; serve para levá-los a um disco maior | macOS ~/.ollama/models, Windows C:\Users\%username%\.ollama\models, Linux /usr/share/ollama/.ollama/models |
OLLAMA_KEEP_ALIVE |
Quanto tempo o modelo fica na memória depois do último uso; -1 mantém carregado | 5m (5 minutos) |
OLLAMA_CONTEXT_LENGTH |
O tamanho de contexto padrão | Conforme a VRAM (menos de 24 GiB: 4k / 24–48 GiB: 32k / 48 GiB ou mais: 256k) |
OLLAMA_NUM_PARALLEL |
Quantas requisições um mesmo modelo atende ao mesmo tempo | 1 |
OLLAMA_ORIGINS |
Origens que podem acessá-lo pelo navegador (separadas por vírgula) | 127.0.0.1 e 0.0.0.0 |
OLLAMA_NO_CLOUD |
Com 1, desliga os recursos de nuvem (inferência remota e busca na web) e fica só no local | Desligado |
O jeito de definir depende do sistema (FAQ oficial). No Windows, feche o Ollama pela barra de tarefas, crie uma variável de usuário nas configurações de variáveis de ambiente e abra o Ollama de novo pelo menu Iniciar. No macOS, defina com algo como launchctl setenv OLLAMA_HOST "0.0.0.0:11434" e reinicie o app. No Linux (rodando com systemd), faça assim:
systemctl edit ollama.service
# acrescente uma linha por variável abaixo de [Service]
# Environment="OLLAMA_HOST=0.0.0.0:11434"
systemctl daemon-reload
systemctl restart ollama
⚠️ Atenção ao tamanho do contexto: o tamanho de contexto padrão depende da sua VRAM e, abaixo de 24 GiB, é de apenas 4k. Isso não basta para documentos longos nem para agentes de programação, e o modelo esquece o que veio antes sem mostrar erro nenhum. Os sintomas e a correção estão no artigo sobre Ollama + Cline.
8. Solução de problemas
Aqui estão as travadas comuns e suas soluções, logo de cara.
Lento ou travando
Se a coluna PROCESSOR do ollama ps não mostrar "100% GPU", o modelo não cabe na VRAM. Desça um tamanho ou use uma versão mais quantizada.
Travamentos por falta de memória
Conte com pelo menos 8 GB de RAM mesmo para 7B, e cerca de 16 GB para 13B ou mais. Um contexto maior consome ainda mais, então deixe o num_ctx no que você precisa.
API não conecta
Verifique se o servidor (o app ou o ollama serve) está rodando e se nada mais usa a porta 11434. Para conectar de outra máquina, defina OLLAMA_HOST como 0.0.0.0.
Modelo não encontrado
Quase sempre é um erro de digitação no nome ou na tag de tamanho. Confira o nome correto na lista oficial de modelos.
Onde ficam os logs
No Windows, o server.log em %LOCALAPPDATA%\Ollama; no macOS, ~/.ollama/logs; no Linux, rode journalctl -u ollama.
Falta espaço no C:
Mude os modelos para outro disco com OLLAMA_MODELS. A pasta de instalação muda com OllamaSetup.exe /DIR="d:\some\location".
Resumo
O Ollama é o caminho mais rápido para entrar nos LLMs locais. Três pontos-chave:
- Configure em minutos: instale a partir do site oficial e depois é só
ollama run <model>. Pouquíssimos comandos para aprender. - Escolha modelos pelo tamanho: fique dentro da sua VRAM. Na dúvida, comece na classe 7B e escolha uma linhagem pelo caso de uso.
- A API é o valor de verdade: a API compatível com OpenAI em
localhost:11434permite integrá-la aos seus próprios apps e interfaces de chat — e servir de plano B para a nuvem.
Comece digitando ollama run qwen3. A melhor forma de aprender é executá-lo enquanto confere as diferenças em relação à nuvem e como escolher um modelo.
Daí em diante, se você quiser avançar até conectar o modelo ao editor e fazê-lo escrever código, o artigo programando com um LLM local trata da configuração do Cline e do Continue, além do tamanho de contexto que faz o agente quebrar sem nunca exibir um erro.
FAQ
P. O Ollama é gratuito? Posso usá-lo comercialmente?
R. O Ollama em si é gratuito e de código aberto. No entanto, cada modelo que você roda tem a própria licença, e o uso comercial depende do modelo. Verifique os termos de cada modelo antes de usar em produto (veja a seção de licenciamento do nosso comparativo de modelos).
P. Ollama ou LM Studio — qual é melhor?
R. Para comandos, APIs, automação e integração nos seus próprios apps, Ollama; se você quer começar fácil com uma GUI, LM Studio. Ambos são gratuitos, então, na dúvida, instale os dois e compare.
Q. Meus dados são enviados para fora?
A. Enquanto você roda um modelo na sua própria máquina, o processamento fica no seu PC; a FAQ oficial afirma que, localmente, o Ollama não vê seus prompts nem seus dados. Mas o Ollama também oferece modelos hospedados na nuvem, e, se você escolher um deles, sua entrada é processada nos servidores do Ollama (que diz não armazená-la nem usá-la para treino). Para ficar só no local, defina OLLAMA_NO_CLOUD=1.
Q. Como atualizar ou desinstalar?
A. No Windows e no macOS, as atualizações são baixadas sozinhas e aplicadas ao clicar em "Restart to update" no ícone. No Linux, rode de novo a linha de instalação. Para desinstalar no Windows, remova-o pela lista de aplicativos das Configurações; no macOS, apague os itens indicados na página oficial do macOS. Os modelos continuam na pasta .ollama, então apague-a também se não precisar mais deles.
P. Posso usá-lo com código OpenAI existente?
R. Sim. O Ollama expõe uma API compatível com OpenAI em localhost:11434/v1, então, na maioria dos casos, você só muda a URL do endpoint e o nome do modelo. Prático para migrar da nuvem para local, ou como plano B.
P. Que tipo de PC eu preciso?
R. Como referência, ao menos 8 GB de RAM para modelos 7B e 16 GB+ para 13B em diante. Para mais conforto, uma GPU compatível (8 GB+ de VRAM) ou um Mac com bastante memória unificada ajuda. Veja o artigo sobre requisitos de hardware para detalhes.