docs: scope-fix — Jetson extern, F-02-Spike entfernt, DAG vereinfacht

Der Modell-Server ist externer Dienst. F-05 portiert direkt gegen
OpenAI-compat API (MODEL_BASE_URL konfigurierbar). ADR-0004 aktualisiert.
F-03/F-04/F-05 werden nach F-01 parallel frei.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
2026-06-03 23:29:56 +02:00
parent b7b6766364
commit d5dc7f36b3
5 changed files with 36 additions and 108 deletions

View File

@@ -1,15 +1,18 @@
# 0004 — Modell-API-Format: erst Spike, dann Connector
# 0004 — Modell-Connector gegen OpenAI-kompatible API, kein Spike nötig
- **Status:** accepted
- **Kontext:** Der Jetson Orin Nano Super hostet ein lokales Modell. Das
Endpoint-Schema ist nicht festgelegt (mögliche Backends: Ollama,
llama.cpp-HTTP-Server, vLLM, custom FastAPI). Kein golden oracle.
- **Entscheidung:** F-02 (🔬 Spike) läuft **vor** F-05 (🔌 Connector).
Der Spike bestimmt das tatsächliche API-Schema und erzeugt eine
Mini-Spec (`spike/model-api/spec.md`). F-05 portiert gegen diese Spec.
- **GO-Kriterium:** Python-Skript sendet eine Test-Nachricht und empfängt
eine nicht-leere Antwort vom lokalen Server. Latenz < 30 s akzeptabel.
- **NO-GO-Kriterium:** Kein Endpoint erreichbar oder Antwort-Format
vollständig undokumentiert Human-Entscheid, welcher Backend aufzusetzen.
- **Konsequenz:** F-05 bleibt bis Spike + GO. Wenn NO-GO: blocked-extern.
Spike-Branch `spike/model-api` wird nach GO verworfen; Spec bleibt in `docs/`.
- **Status:** accepted (ersetzt: 2026-06-03, vorherige Version sah Spike vor)
- **Kontext:** Der selbst gehostete Modell-Server (Jetson Orin Nano Super) ist
ein **externer Dienst** außerhalb dieses Repos. Das Backend (Ollama, llama.cpp,
vLLM o. ä.) ist Sache des Betreibers, nicht dieses Projekts.
- **Entscheidung:** Der Connector (F-05) portiert gegen die **OpenAI Chat
Completions API** (`POST /v1/chat/completions`). Das ist der de-facto-Standard
für selbst gehostete Modelle. Die Basis-URL wird via Env-Var `MODEL_BASE_URL`
konfiguriert. Kein Spike nötig — die API-Spec ist bekannt und stabil.
- **Gründe:**
- Ollama, llama.cpp-HTTP, vLLM und LiteLLM exponieren alle diese Schnittstelle.
- Der Connector funktioniert mit jedem Backend, das sich daran hält.
- Ein Spike wäre nur nötig, wenn das API-Format unbekannt wäre — das ist hier
nicht der Fall.
- **Konsequenz:** Wenn der externe Server ein nicht-kompatibles Format hat,
ist das ein Ops-Problem, kein Code-Problem. F-05 dokumentiert das erwartete
Schema im Manifest (R-0006).