Files
jetson-ai-ollama/docs/adr/0002-ollama-native.md
Tarik Moussa efee259d01
Some checks failed
gates / quality (push) Has been cancelled
feat: bootstrap jetson-ai-ollama from agent-swarm template
Leader-Bootstrap (Planung) aus Template + Jetson-Meta-Prompt:
- ROADMAP-Board W1-W6 als Abhaengigkeits-DAG (Ready-Set = {W1})
- STATE mit disjunkter Datei-Ownership W2-W6
- CONVENTIONS Projekt-Vertrag (Profile, Pfade, Ports, Daemon-Env, num_ctx, DVC, Scope)
- manifests/requirements.md = kalt verifizierbares Review-Manifest (R-01..R-10)
- REVIEW.md Kalt-Review-Einstieg; ADR 0002 (Ollama-nativ, kein Swapper/Gateway)
- session-prompts/W1..W6 dispatch-fertig; .gitignore um Jetson-Ignores erweitert
- examples/walkthrough entfernt (Projekt hat eigenes gefuelltes Board)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-03 06:57:40 +02:00

1.2 KiB

0002 — Ollama-natives Modell-Management, kein eigener Swapper/Gateway

  • Status: accepted
  • Kontext: Jetson Orin Nano Super 8 GB (~7,4 GB nutzbar), Single-User, latenzgebunden. Drei Profile (light/gemma/heavy) nötig, aber nie zwei gleichzeitig resident. Frühere Ansätze hätten einen eigenen Modell-Swapper oder ein API-Gateway vor Ollama gesetzt.
  • Entscheidung: Der Ollama-Daemon serviert die Modelle nativ (Wechsel per Modellname über die OpenAI-kompatible API). OLLAMA_MAX_LOADED_MODELS=1 hält genau ein Modell resident (8-GB-Schutz); ein weiteres Profil belegt erst bei Anfrage Speicher. Kein eigener Swapper, kein Gateway. DVC bleibt Modell-Source-of- Truth, Ollamas Blob-Store ist nur Laufzeit-Cache.
  • Konsequenz: Drei Profile quasi gratis (laden on-demand), kein Custom-Code für Modellwechsel, kleinere Angriffsfläche. Preis: kurzer OLLAMA_KEEP_ALIVE=30s → Ladezeit beim Profilwechsel — bei Single-User akzeptabel (keine fremde Session wird unterbrochen). Externer Zugriff/Auth/Metrik-Aggregation liegen bewusst off-box (nginx-Proxy, Prometheus) — siehe CONVENTIONS.md Scope-Grenze.
  • Superseded by: (noch keins)