0.5. Die KI-Umgebung
Unter Was sind LLMs steht die Maschine. Unter KI-Nutzung steht das Handwerk: Spec, Plan, Prüfung, Regeln, Skills, Agenten. Dieses Kapitel ist die Landkarte dazwischen: Was um das Modell herumsteht, damit aus einem Chat eine KI-Umgebung wird.
Eine moderne Umgebung ist nicht „ein LLM, Glossar, öffnet in neuem Tab in einer Box“. Es ist ein Modell — oft mehrere — in einer Agent Harness, Glossar, öffnet in neuem Tab : einer Laufzeit, die Kontext zusammensetzt, Werkzeuge ausführt, Rechte prüft und die Schleife steuert. Darauf sitzen Agent, Glossar, öffnet in neuem Tab -Profile, persistente Anweisungen (Rules, Glossar, öffnet in neuem Tab ), situative Skills, Glossar, öffnet in neuem Tab , Host-Werkzeuge und MCP, Glossar, öffnet in neuem Tab . Außen liegen Repo, Terminal, Web und Tracker. Und darunter — oder als Sensor in derselben Schleife — der Evaluation Harness, Glossar, öffnet in neuem Tab : Tests, Build, Review, kleine Diffs, Glossar, öffnet in neuem Tab .
Produktnamen unterscheiden sich. Das Lehrbare ist das kanonische Bild. Wo etwas nur bei einem Anbieter vorkommt und nicht nur ein anderer Name für denselben Kasten ist, steht das ausdrücklich daneben.
flowchart TB UI["Mensch / Oberfläche<br/>Modi · Freigaben · Slash-Befehle"] RUNTIME["Agent Harness — Laufzeit<br/>Kontext · LLM-Aufruf · Tool-Schleife · Stopp / Budget"] PROFILE["Agent-Profil<br/>Persona · Ziele · Tool-Liste · optional Modell"] GUIDE["Persistente Anweisungen<br/>Rules · AGENTS.md · CLAUDE.md · Custom Instructions"] SKILLS["Skills-Katalog<br/>Metadaten immer · Körper bei Bedarf"] LLM["LLM-Anbieter<br/>ein oder mehrere Modelle"] HOST["Host-Werkzeuge<br/>Dateien · Shell · Browser · Git …"] MCP["MCP-Server<br/>Tools · Resources · Prompts"] WORLD["Externe Welt<br/>Repo · Terminals · Web · Tracker · DBs"] VERIFY["Evaluation Harness<br/>Tests · Build · Linter · CI · Telemetrie"] GATE["Steuerung<br/>Rechte · Modi · Hooks"] UI --> RUNTIME GUIDE --> RUNTIME PROFILE --> RUNTIME SKILLS --> RUNTIME GATE -.->|erlaubt / blockiert| RUNTIME RUNTIME <--> LLM RUNTIME --> HOST RUNTIME --> MCP HOST --> WORLD MCP --> WORLD WORLD -->|Beobachtung| RUNTIME RUNTIME --> VERIFY VERIFY -->|bestanden / fehlgeschlagen| RUNTIME
Lies das Bild von oben nach unten: Der Mensch setzt Modus und Freigaben. Die Laufzeit baut den Prompt, Glossar, öffnet in neuem Tab , ruft das Modell, führt Werkzeuge aus und legt Beobachtungen zurück — ReAct, Glossar, öffnet in neuem Tab und Function Calling, Glossar, öffnet in neuem Tab . Persistente Anweisungen und Skills füttern denselben Kontext unterschiedlich: immer bzw. bei Bedarf. Rechte und Hooks sitzen als Gatter auf den Werkzeugkanten. Die externe Welt liefert Dateien und Seiteneffekte. Der Evaluation Harness sagt bestanden oder nicht — nicht das Modell über sich selbst.
Ohne Laufzeit ist ein LLM ein Fortsetzer von Text. Mit Laufzeit wird daraus ein Agent: Das Modell schreibt strukturierte Werkzeugaufrufe; die Anwendung führt aus und legt das Ergebnis zurück. Genau das meint Function Calling. Die Vertrauensgrenze liegt im Host, nicht in den Gewichten.
Was die Laufzeit in jedem Schritt typischerweise tut:
- Kontext zusammensetzen: Systemhinweis, Rules, geladene Skills, Verlauf, Tool-Schemas, ggf. Datei-Ausschnitte.
- Ein oder mehrere Modelle aufrufen.
- Tool-Aufrufe parsen und gegen Rechte, Modi und Hooks prüfen.
- Ausführen und Beobachtungen anhängen.
- Stoppen, komprimieren oder ein Budget greifen lassen.
Anthropic nennt diese umgebende Software ausdrücklich agent harness (oder scaffold): Sie verarbeitet Eingaben, orchestriert Werkzeugaufrufe und liefert Ergebnisse. Wenn man „einen Agenten“ bewertet, bewertet man Laufzeit und Modell zusammen — Claude Code ist ein Beispiel für so eine flexible Harness. OpenAI beschreibt denselben Fortgang in der Agents-API: Nach Tool-Ergebnissen „continues the turn“ die Harness.
Ein Agent, Glossar, öffnet in neuem Tab ist hier keine neue Modellklasse. Es ist eine Konfiguration: Anweisungen (Persona, Ziele), erlaubte Werkzeuge, optional eigenes Modell, optional MCP-Server. Dieselbe Schleife, anderer Rahmen.
In der Praxis heißt das Artefakt unterschiedlich — der Kasten im Diagramm bleibt derselbe:
| Kanonisch | Typische Produktform |
|---|---|
| Agent-Profil | OpenAI Agent(…) · Copilot .agent.md · Claude .claude/agents/ · Cursor-Subagent |
Mehrere Profile oder Subagenten sind optional. Sie bekommen oft ein eigenes Kontextfenster und eine engere Tool-Liste und melden eine Zusammenfassung zurück. Das ist Routing und Isolation — kein zweites Gehirn. Multi-Agent-Frameworks bleiben eine spätere Produktschicht; die Kernfähigkeit ist weiterhin ein Modell in einer Werkzeugschleife.
Modelle behalten zwischen Sitzungen kein zuverlässiges Projektgedächtnis in den Gewichten. Was sich wiederholt — Stil, Testbefehl, „keine Secrets in Logs“ — gehört in Dateien, die die Laufzeit oft oder immer in den Kontext legt.
| Kanonisch | Produktnamen (Beispiele) |
|---|---|
| Persistente Anweisungen / Rules | Cursor Rules, AGENTS.md · CLAUDE.md, .claude/rules/ · Copilot Custom Instructions (.github/copilot-instructions.md, path-spezifisch, persönlich/org) |
Das sind weiche Vorgaben: Das Modell sieht den Text und soll folgen. Es ist keine Durchsetzung. Claude Code sagt das klar: CLAUDE.md ist Kontext, keine erzwungene Konfiguration — Blockieren geht über Hooks und Rechte. Cursor sagt dasselbe für Rules: mit Enforcement-Hooks kombinieren.
Daueranweisungen kosten Tokens in jedem Lauf. Kurz, konkret, grounded — und Domain-Workflows eher in Skills auslagern. Unter KI-Nutzung steht die Praxisstufe dazu.
Skills, Glossar, öffnet in neuem Tab
sind situative Ablaufpakete: ein Verzeichnis mit mindestens SKILL.md (Name, Beschreibung, Anleitung) und optional Skripten, Referenzen, Assets. Der offene Standard Agent Skills
beschreibt progressive disclosure: Metadaten liegen bereit; der Körper wird erst bei Bedarf geladen; weitere Dateien folgen danach.
| Rules | Skills | |
|---|---|---|
| Wann im Kontext | oft immer oder pfadbasiert | wenn relevant / manuell |
| Zweck | stabile Konventionen | wiederkehrende Workflows |
| Kosten | dauernd | gezielt |
Skills sind keine Tools und kein MCP. Tools führen die Welt aus. Skills erklären dem Agenten wie ein Ablauf aussehen soll — und können dabei auf Tools verweisen. Cursor und Claude Code lesen dieselben SKILL.md-Konventionen; Copilot nutzt den Markennamen seltener und steuert über Instructions und Agent-Profile.
Zwei Wege in dieselbe externe Welt:
- Host-Werkzeuge baut das Produkt ein: Dateien lesen/schreiben, Shell, Browser, Git, eingebaute Suchen.
- MCP, Glossar, öffnet in neuem Tab ist die Steckerleiste dazwischen: ein Host spricht mit Servern, die Tools, Resources und Prompts anbieten. MCP legt nicht fest, wie das LLM gesteuert wird — nur, wie Kontext und Fähigkeiten angebunden werden.
Beide landen im Diagramm als Kanten von der Laufzeit zur Welt. Ein aufgeblähter Tool-Katalog füllt dasselbe Working Memory, Glossar, öffnet in neuem Tab wie zu viele Dateien — siehe Context Rot, Glossar, öffnet in neuem Tab unter Problemen bei der Nutzung.
Fremde MCP-Server gehören geprüft wie fremde Pakete: Herkunft, Rechte, welche Daten abfließen.
Weiche Anweisungen reichen nicht, sobald Seiteneffekte möglich sind. Die harte Ebene sitzt im Diagramm als Gatter:
- Rechte / Allowlists: welche Tools überhaupt, mit welcher Freigabe (nur lesen, Edit akzeptieren, nachfragen, …).
- Mode, Glossar, öffnet in neuem Tab
: ändert Policy und Workflow-Stufe, nicht die Definition von Skill oder Rule. Typisch: Plan zuerst (recherchieren, Plan reviewen, dann bauen) versus direkt Agent. Claude Code kennt Permission-Modi inkl.
plan(lesen, nicht schreiben); Cursor kennt Plan Mode und Run Modes für Freigaben. - Hook, Glossar, öffnet in neuem Tab : deterministische Skripte am Lebenszyklus (vor Shell, vor MCP, vor Compact, am Stopp). Sie dürfen blockieren oder umbiegen, wo Rules nur bitten.
Ohne diese Ebene multipliziert Least Privilege, Glossar, öffnet in neuem Tab
-Rhetorik nichts. Mit ihr bleibt Human Approval vor High-Impact möglich — und bypassPermissions-artige Schalter bewusst riskant.
Das Wort Harness, Glossar, öffnet in neuem Tab meint in der Praxis zwei verschiedene Kästen. Beide gehören ins Bild; sie sind nicht austauschbar.
Die Software um das Modell: Kontext, Tool-Schleife, Rechte, Stoppbedingungen. Ohne sie gibt es keinen Agenten, nur Chat. Beispiele: Claude Code, Cursor Agent, OpenAI Runner um ein Agent-Objekt, Codex als workspace-bezogene Coding-Harness.
Äußere Orakel, die schlechte Ausgabe falsifizieren: Tests, Build, Linter, CI, Simulationen, Telemetrie. Datadog formuliert „harness-first“ so: Das Modell erzeugt, der Harness prüft. Anthropic trennt in Eval-Texten dasselbe Wort noch einmal: eine evaluation harness führt Aufgaben aus und bewertet — das ist Cousin des Prüfstands, nicht dasselbe wie die Agent-Laufzeit.
Unter KI-Nutzung war „Tests und kleine Diffs sind der Evaluation Harness“ genau diese zweite Lesart. Eine starke Agent Harness ohne Evaluation Harness skaliert Fehler nur schneller. Eine starke Testplattform ohne Laufzeit ist klassische Entwicklung — beides zusammen ist die KI-Umgebung.
| Stück | Warum es zählt |
|---|---|
| Tool-Schemas im Kontext | Die Laufzeit zeigt dem Modell die Kataloge; zu große Kataloge verschwenden Tokens. |
| Mehrere Modelle | Plan/Explore günstig, Umsetzung teurer — „der Agent“ ist nicht eine Model-ID. |
| Speicherarten | Sitzungsprotokoll ≠ Rules-Datei ≠ optionales Auto-Memory. |
| Budgets | Tokens, Turns, Kosten — Agent-Schleifen sind teurer als ein kurzer Chat. |
| Observability | Traces und Hooks machen Fehlschläge debuggbar und bewertbar. |
| Inner vs. outer | Vendor-Laufzeit innen; Rules, Skills, MCP, CI außen dazugekauft. |
NoteAnbieter-spezifisch, nicht nur ein Synonym: Claude Code kann ein Auto-Memory schreiben (vom Modell gepflegte Notizen nebenCLAUDE.md). Cursor kann einen Skill als Custom Mode für die ganze Session im Kontext halten. Beides ist optionaler Zusatz zum kanonischen Bild — kein eigener Grundkasten für jede Umgebung.
| Begriff | Kanonisch hier | Häufige Produktnamen |
|---|---|---|
| Agent | Modell in Tool-Schleife | Agent-Chat, Coding Agent, Subagent |
| Agent-Profil | Persona + Tools (+ Modell/MCP) | .agent.md, Agent(…), .claude/agents/ |
| Agent Harness | Laufzeit um das Modell | „Agent“, Claude Code, Runner |
| Evaluation Harness | Prüfstand / Orakel | Tests, CI, /verify, Eval-Harness |
| Rules | persistente weiche Anweisungen | Rules, AGENTS.md, CLAUDE.md, Custom Instructions |
| Skill | situatives Ablaufpaket | SKILL.md, Skillsets |
| Tool | vom Host ausgeführte Fähigkeit | Shell, Edit, Browser, Function |
| MCP | Steckerleiste Host ↔ Server | mcp.json, MCP servers |
| Mode | Policy / Workflow-Stufe | Plan Mode, permission modes, Run Modes |
| Hook | deterministisches Gatter | hooks.json, PreToolUse |
- Die KI-Umgebung ist Modell + Laufzeit + Welt + Prüfstand — nicht die Chat-Box allein.
- Rules, Skills, Tools und MCP sind vier verschiedene Kästen.
- Weiche Anweisungen steuern Ton und Konvention; Hooks und Rechte steuern Schaden.
- Agent Harness und Evaluation Harness teilen ein Wort und zwei Jobs. Beide benennen.
- Produkt-UIs wechseln Namen. Das kanonische Diagramm bleibt die Landkarte; Synonyme gehören in die Tabelle, nicht als neue Architektur.
NoteWer nur wenige Quellen will: Anthropic Demystifying evals (Agent- vs. Evaluation-Harness), Agent-Skills-Spezifikation, MCP Architecture, Cursor Rules/Skills/Hooks, Copilot Custom Instructions / Custom Agents, OpenAI Agents SDK.
-
Anthropic: Demystifying evals for AI agents (extern)
Agent harness / scaffold; Evaluation harness; Claude Code als Beispiel. -
OpenAI: Agents API — Functions (extern)
Nach Tool-Ergebnissen setzt die Harness den Turn fort. -
Datadog: Harness-first agents (extern)
Modell erzeugt, Harness prüft; Investition in Orakel. -
OpenAI Agents SDK: Agents (extern)
Agent = LLM + instructions + tools (+ MCP); Runner; Hooks.
-
Cursor: Rules (extern)
· Customizing agents (extern)
Rules vs Skills;AGENTS.md. -
Claude Code: CLAUDE.md / memory (extern)
Kontext, nicht Enforcement; Auto-Memory; Import vonAGENTS.md. -
GitHub: Customizing Copilot (extern)
Custom Instructions; Precedence; agent instructions. -
GitHub: Create custom agents (extern)
.agent.md: tools, mcp-servers, model, Prompt-Körper. -
Agent Skills specification (extern)
· Anthropic: Agent Skills (extern)
SKILL.md; progressive disclosure. -
Cursor: Skills (extern)
· Claude Code: Skills (extern)
On-demand Laden; Kompatibilitätspfad.
-
MCP: Introduction (extern)
· Architecture (extern)
USB-C-Bild; Host, Client, Server; Tools / Resources / Prompts. -
Cursor: Hooks (extern)
· Claude Code: Permissions (extern)
Deterministische Gatter; Permission-Modi inkl. Plan. -
Cursor: Plan Mode (extern)
Explore → Plan → Implement nach Freigabe. -
Claude Code: Subagents (extern)
Eigenes Fenster, eigene Tools; Explore / Plan / general-purpose.