← Tutti gli articoli

Stack LLM locale: Ollama + Qdrant + Open WebUI

Zero dipendenza da API cloud, zero token cost, latenza sub-secondo per RAG. Lo stack che gira sull'iMac Archimede da mesi.

Componenti

  • Ollama — runtime LLM, 3 modelli: qwen2.5-coder:14b, deepseek-r1:14b, gemma3:12b
  • Qdrant — vector database per embeddings e RAG, dockerizzato
  • Open WebUI — interfaccia web, accessibile via Tailscale
  • n8n — workflow orchestration
  • PM2 — process management, autorestart on crash

Deploy Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5-coder:14b
ollama pull deepseek-r1:14b
ollama pull gemma3:12b

Deploy Qdrant via Docker

docker run -d --restart unless-stopped \
  -p 6333:6333 -p 6334:6334 \
  -v //qdrant_storage:/qdrant/storage \
  --name qdrant qdrant/qdrant

Performance reale misurata

  • qwen2.5-coder:14b: 18-25 tok/s
  • deepseek-r1:14b: 12-18 tok/s (chain-of-thought)
  • gemma3:12b: 22-30 tok/s
  • Qdrant 100K docs: 8-15ms per query

Costi confrontati

Cloud (Claude Sonnet API) workload 5M token/mese: ~€60-90/mese. Stack locale: €0 dopo investimento hardware.

← Altri articoli ✉ Discutiamone