Some checks failed
gates / quality (push) Has been cancelled
Leader-Bootstrap (Planung) aus Template + Jetson-Meta-Prompt:
- ROADMAP-Board W1-W6 als Abhaengigkeits-DAG (Ready-Set = {W1})
- STATE mit disjunkter Datei-Ownership W2-W6
- CONVENTIONS Projekt-Vertrag (Profile, Pfade, Ports, Daemon-Env, num_ctx, DVC, Scope)
- manifests/requirements.md = kalt verifizierbares Review-Manifest (R-01..R-10)
- REVIEW.md Kalt-Review-Einstieg; ADR 0002 (Ollama-nativ, kein Swapper/Gateway)
- session-prompts/W1..W6 dispatch-fertig; .gitignore um Jetson-Ignores erweitert
- examples/walkthrough entfernt (Projekt hat eigenes gefuelltes Board)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
19 lines
1.2 KiB
Markdown
19 lines
1.2 KiB
Markdown
# 0002 — Ollama-natives Modell-Management, kein eigener Swapper/Gateway
|
|
|
|
- **Status:** accepted
|
|
- **Kontext:** Jetson Orin Nano Super 8 GB (~7,4 GB nutzbar), Single-User,
|
|
latenzgebunden. Drei Profile (light/gemma/heavy) nötig, aber nie zwei gleichzeitig
|
|
resident. Frühere Ansätze hätten einen eigenen Modell-Swapper oder ein API-Gateway
|
|
vor Ollama gesetzt.
|
|
- **Entscheidung:** Der **Ollama-Daemon serviert die Modelle nativ** (Wechsel per
|
|
Modellname über die OpenAI-kompatible API). `OLLAMA_MAX_LOADED_MODELS=1` hält genau
|
|
ein Modell resident (8-GB-Schutz); ein weiteres Profil belegt erst bei Anfrage
|
|
Speicher. **Kein eigener Swapper, kein Gateway.** **DVC bleibt Modell-Source-of-
|
|
Truth**, Ollamas Blob-Store ist nur Laufzeit-Cache.
|
|
- **Konsequenz:** Drei Profile quasi gratis (laden on-demand), kein Custom-Code für
|
|
Modellwechsel, kleinere Angriffsfläche. Preis: kurzer `OLLAMA_KEEP_ALIVE=30s` →
|
|
Ladezeit beim Profilwechsel — bei Single-User akzeptabel (keine fremde Session wird
|
|
unterbrochen). Externer Zugriff/Auth/Metrik-Aggregation liegen bewusst off-box
|
|
(nginx-Proxy, Prometheus) — siehe `CONVENTIONS.md` Scope-Grenze.
|
|
- **Superseded by:** _(noch keins)_
|