NOTA 9/10 — Ferramenta prática, madura, bem-documentada e totalmente gratuita para rodar LLMs localmente; relevância comprovada com 9 milhões de usuários e caso de uso claro para tutoriais hands-on.
---
🦙 Rodando IA Local com Ollama
📌 Pra que serve
Ollama é um executor de modelos de linguagem que roda no seu PC/Mac/Linux sem depender de APIs online. Perfeito pra quem quer privacidade, economia de créditos ou está offline — você baixa modelos como Llama, Mistral ou DeepSeek e interage via linha de comando ou API REST na porta 11434.
🛠️ Passo a passo
1. Instale o Ollama
- Acesse [ollama.com](https://ollama.com)
- Download para seu SO (macOS, Linux ou Windows)
- Execute o instalador; o serviço rodará em background
2. Abra o terminal e execute seu primeiro modelo
ollama run llama2Aguarde o download (tamanho varia: Llama2 ~4GB). Depois, converse diretamente no terminal.
3. Teste a API REST
Em outro terminal:
curl http://localhost:11434/api/generate -d '{
"model": "llama2",
"prompt": "Olá, qual é o significado da vida?",
"stream": false
}'4. Use com Python (opcional, pra quem quer integrar)
import requests
response = requests.post('http://localhost:11434/api/generate', json={
"model": "llama2",
"prompt": "Explique machine learning"
})
print(response.json())5. Gerencie modelos
ollama list # Lista instalados
ollama pull mistral # Baixa Mistral
ollama rm llama2 # Remove Llama2💡 Dica: Use modelos quantizados (ex: ollama run neural-chat) pra economizar RAM. Ative GPU com CUDA_VISIBLE_DEVICES=0 ollama serve se tiver NVIDIA. Em Apple Silicon, já vem otimizado.
🔗 Links e instalação
- Site oficial: https://ollama.com
- GitHub: https://github.com/ollama/ollama
- Documentação API: https://github.com/ollama/ollama/blob/main/docs/api.md
- Modelos disponíveis: https://ollama.com/library
- Docker:
docker r