---
🦙 Rode um LLM Local com Ollama
📌 Pra que serve
Ollama permite rodar modelos de linguagem grandes no seu próprio computador sem depender de APIs pagas na nuvem. Ideal para prototipagem, privacidade, experimentação offline e classificação de dados locais. Acesse via CLI ou HTTP API, integre em Node.js e outros projetos.🛠️ Passo a passo
1. Instale Ollama
- Acesse [ollama.com](https://ollama.com) e baixe o instalador para seu SO
- Ou no Linux/macOS:
curl -fsSL https://ollama.com/install.sh | sh- Verifique:
ollama --version
2. Teste o primeiro modelo
ollama run llama3.2:3bPeça: "Explique um closure em JavaScript em três frases"
Saia com
/bye3. Chame via HTTP (básico, sem streaming)
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2:3b",
"messages": [{"role": "user", "content": "O que retorna Array.map()?"}],
"stream": false
}'4. Integre com Node.js
Crie chat.js:
const controller = new AbortController();
const timeout = setTimeout(() => controller.abort(), 30000);try {
const response = await fetch('http://localhost:11434/api/chat', {
method: 'POST',
headers: { 'content-type': 'application/json' },
body: JSON.stringify({
model: 'llama3.2:3b',
messages: [{ role: 'user', content: 'Resuma REST em uma frase' }],
stream: false
}),
signal: controller.signal
});
const data = await response.json();
console.log(data.message.content);
} finally { clearTimeout(timeout); }
Execute:
node chat.js5. Streaming (receba resposta em tempo real)
A resposta vem em NDJSON. Use response.body.getReader() para processar chunks conforme chegam — ótimo para UIs responsivas.
6. Saída estruturada (JSON Schema)
Peça respostas em formato fixo passando format com schema:
format: {
type: 'object',
properties: {
topic: { type: 'string' },
difficulty: { type: 'string', enum: ['beginner', 'intermedi
ate', 'advanced'] }
}
}💡 Dica:
Comece comllama3.2:3b (3 bilhões de parâmetros). Modelos menores rodam rápido em qualquer máquina; modelos maiores precisam mais VRAM. Teste seu caso real com 10-20 prompts antes de subir de tamanho. Use ollama ps para ver qual modelo está carregado e se roda em GPU ou CPU.🔗 Links e instalação
- Site oficial: https://ollama.com
- Documentação completa: https://flaviocopes.com/ollama-local-llm/
- Modelos disponíveis: https://ollama.com/library
- Comando de gerenciamento:
ollama list,ollama rm [modelo],ollama stop [modelo]