Some checks failed
gates / quality (push) Has been cancelled
Leader-Bootstrap (Planung) aus Template + Jetson-Meta-Prompt:
- ROADMAP-Board W1-W6 als Abhaengigkeits-DAG (Ready-Set = {W1})
- STATE mit disjunkter Datei-Ownership W2-W6
- CONVENTIONS Projekt-Vertrag (Profile, Pfade, Ports, Daemon-Env, num_ctx, DVC, Scope)
- manifests/requirements.md = kalt verifizierbares Review-Manifest (R-01..R-10)
- REVIEW.md Kalt-Review-Einstieg; ADR 0002 (Ollama-nativ, kein Swapper/Gateway)
- session-prompts/W1..W6 dispatch-fertig; .gitignore um Jetson-Ignores erweitert
- examples/walkthrough entfernt (Projekt hat eigenes gefuelltes Board)
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
1.2 KiB
1.2 KiB
0002 — Ollama-natives Modell-Management, kein eigener Swapper/Gateway
- Status: accepted
- Kontext: Jetson Orin Nano Super 8 GB (~7,4 GB nutzbar), Single-User, latenzgebunden. Drei Profile (light/gemma/heavy) nötig, aber nie zwei gleichzeitig resident. Frühere Ansätze hätten einen eigenen Modell-Swapper oder ein API-Gateway vor Ollama gesetzt.
- Entscheidung: Der Ollama-Daemon serviert die Modelle nativ (Wechsel per
Modellname über die OpenAI-kompatible API).
OLLAMA_MAX_LOADED_MODELS=1hält genau ein Modell resident (8-GB-Schutz); ein weiteres Profil belegt erst bei Anfrage Speicher. Kein eigener Swapper, kein Gateway. DVC bleibt Modell-Source-of- Truth, Ollamas Blob-Store ist nur Laufzeit-Cache. - Konsequenz: Drei Profile quasi gratis (laden on-demand), kein Custom-Code für
Modellwechsel, kleinere Angriffsfläche. Preis: kurzer
OLLAMA_KEEP_ALIVE=30s→ Ladezeit beim Profilwechsel — bei Single-User akzeptabel (keine fremde Session wird unterbrochen). Externer Zugriff/Auth/Metrik-Aggregation liegen bewusst off-box (nginx-Proxy, Prometheus) — sieheCONVENTIONS.mdScope-Grenze. - Superseded by: (noch keins)