Der Modell-Server ist externer Dienst. F-05 portiert direkt gegen OpenAI-compat API (MODEL_BASE_URL konfigurierbar). ADR-0004 aktualisiert. F-03/F-04/F-05 werden nach F-01 parallel frei. Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
1.1 KiB
1.1 KiB
0004 — Modell-Connector gegen OpenAI-kompatible API, kein Spike nötig
- Status: accepted (ersetzt: 2026-06-03, vorherige Version sah Spike vor)
- Kontext: Der selbst gehostete Modell-Server (Jetson Orin Nano Super) ist ein externer Dienst außerhalb dieses Repos. Das Backend (Ollama, llama.cpp, vLLM o. ä.) ist Sache des Betreibers, nicht dieses Projekts.
- Entscheidung: Der Connector (F-05) portiert gegen die OpenAI Chat
Completions API (
POST /v1/chat/completions). Das ist der de-facto-Standard für selbst gehostete Modelle. Die Basis-URL wird via Env-VarMODEL_BASE_URLkonfiguriert. Kein Spike nötig — die API-Spec ist bekannt und stabil. - Gründe:
- Ollama, llama.cpp-HTTP, vLLM und LiteLLM exponieren alle diese Schnittstelle.
- Der Connector funktioniert mit jedem Backend, das sich daran hält.
- Ein Spike wäre nur nötig, wenn das API-Format unbekannt wäre — das ist hier nicht der Fall.
- Konsequenz: Wenn der externe Server ein nicht-kompatibles Format hat, ist das ein Ops-Problem, kein Code-Problem. F-05 dokumentiert das erwartete Schema im Manifest (R-0006).