# 0002 — Ollama-natives Modell-Management, kein eigener Swapper/Gateway - **Status:** accepted - **Kontext:** Jetson Orin Nano Super 8 GB (~7,4 GB nutzbar), Single-User, latenzgebunden. Drei Profile (light/gemma/heavy) nötig, aber nie zwei gleichzeitig resident. Frühere Ansätze hätten einen eigenen Modell-Swapper oder ein API-Gateway vor Ollama gesetzt. - **Entscheidung:** Der **Ollama-Daemon serviert die Modelle nativ** (Wechsel per Modellname über die OpenAI-kompatible API). `OLLAMA_MAX_LOADED_MODELS=1` hält genau ein Modell resident (8-GB-Schutz); ein weiteres Profil belegt erst bei Anfrage Speicher. **Kein eigener Swapper, kein Gateway.** **DVC bleibt Modell-Source-of- Truth**, Ollamas Blob-Store ist nur Laufzeit-Cache. - **Konsequenz:** Drei Profile quasi gratis (laden on-demand), kein Custom-Code für Modellwechsel, kleinere Angriffsfläche. Preis: kurzer `OLLAMA_KEEP_ALIVE=30s` → Ladezeit beim Profilwechsel — bei Single-User akzeptabel (keine fremde Session wird unterbrochen). Externer Zugriff/Auth/Metrik-Aggregation liegen bewusst off-box (nginx-Proxy, Prometheus) — siehe `CONVENTIONS.md` Scope-Grenze. - **Superseded by:** _(noch keins)_