Zero dipendenza da API cloud, zero token cost, latenza sub-secondo per RAG. Lo stack che gira sull'iMac Archimede da mesi.
Componenti
- Ollama — runtime LLM, 3 modelli: qwen2.5-coder:14b, deepseek-r1:14b, gemma3:12b
- Qdrant — vector database per embeddings e RAG, dockerizzato
- Open WebUI — interfaccia web, accessibile via Tailscale
- n8n — workflow orchestration
- PM2 — process management, autorestart on crash
Deploy Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5-coder:14b
ollama pull deepseek-r1:14b
ollama pull gemma3:12b
Deploy Qdrant via Docker
docker run -d --restart unless-stopped \
-p 6333:6333 -p 6334:6334 \
-v //qdrant_storage:/qdrant/storage \
--name qdrant qdrant/qdrant
Performance reale misurata
- qwen2.5-coder:14b: 18-25 tok/s
- deepseek-r1:14b: 12-18 tok/s (chain-of-thought)
- gemma3:12b: 22-30 tok/s
- Qdrant 100K docs: 8-15ms per query
Costi confrontati
Cloud (Claude Sonnet API) workload 5M token/mese: ~€60-90/mese. Stack locale: €0 dopo investimento hardware.