Skip to main content
Entwickler Themen
Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Toggle Dark/Light/Auto mode Back to homepage

0.5. Die KI-Umgebung

Kurzfassung

Unter Was sind LLMs steht die Maschine. Unter KI-Nutzung steht das Handwerk: Spec, Plan, Prüfung, Regeln, Skills, Agenten. Dieses Kapitel ist die Landkarte dazwischen: Was um das Modell herumsteht, damit aus einem Chat eine KI-Umgebung wird.

Eine moderne Umgebung ist nicht „ein LLM, Glossar, öffnet in neuem Tab in einer Box“. Es ist ein Modell — oft mehrere — in einer Agent Harness, Glossar, öffnet in neuem Tab : einer Laufzeit, die Kontext zusammensetzt, Werkzeuge ausführt, Rechte prüft und die Schleife steuert. Darauf sitzen Agent, Glossar, öffnet in neuem Tab -Profile, persistente Anweisungen (Rules, Glossar, öffnet in neuem Tab ), situative Skills, Glossar, öffnet in neuem Tab , Host-Werkzeuge und MCP, Glossar, öffnet in neuem Tab . Außen liegen Repo, Terminal, Web und Tracker. Und darunter — oder als Sensor in derselben Schleife — der Evaluation Harness, Glossar, öffnet in neuem Tab : Tests, Build, Review, kleine Diffs, Glossar, öffnet in neuem Tab .

Produktnamen unterscheiden sich. Das Lehrbare ist das kanonische Bild. Wo etwas nur bei einem Anbieter vorkommt und nicht nur ein anderer Name für denselben Kasten ist, steht das ausdrücklich daneben.

Das kanonische Bild

flowchart TB
  UI["Mensch / Oberfläche<br/>Modi · Freigaben · Slash-Befehle"]
  RUNTIME["Agent Harness — Laufzeit<br/>Kontext · LLM-Aufruf · Tool-Schleife · Stopp / Budget"]
  PROFILE["Agent-Profil<br/>Persona · Ziele · Tool-Liste · optional Modell"]
  GUIDE["Persistente Anweisungen<br/>Rules · AGENTS.md · CLAUDE.md · Custom Instructions"]
  SKILLS["Skills-Katalog<br/>Metadaten immer · Körper bei Bedarf"]
  LLM["LLM-Anbieter<br/>ein oder mehrere Modelle"]
  HOST["Host-Werkzeuge<br/>Dateien · Shell · Browser · Git …"]
  MCP["MCP-Server<br/>Tools · Resources · Prompts"]
  WORLD["Externe Welt<br/>Repo · Terminals · Web · Tracker · DBs"]
  VERIFY["Evaluation Harness<br/>Tests · Build · Linter · CI · Telemetrie"]
  GATE["Steuerung<br/>Rechte · Modi · Hooks"]

  UI --> RUNTIME
  GUIDE --> RUNTIME
  PROFILE --> RUNTIME
  SKILLS --> RUNTIME
  GATE -.->|erlaubt / blockiert| RUNTIME
  RUNTIME <--> LLM
  RUNTIME --> HOST
  RUNTIME --> MCP
  HOST --> WORLD
  MCP --> WORLD
  WORLD -->|Beobachtung| RUNTIME
  RUNTIME --> VERIFY
  VERIFY -->|bestanden / fehlgeschlagen| RUNTIME

Lies das Bild von oben nach unten: Der Mensch setzt Modus und Freigaben. Die Laufzeit baut den Prompt, Glossar, öffnet in neuem Tab , ruft das Modell, führt Werkzeuge aus und legt Beobachtungen zurück — ReAct, Glossar, öffnet in neuem Tab und Function Calling, Glossar, öffnet in neuem Tab . Persistente Anweisungen und Skills füttern denselben Kontext unterschiedlich: immer bzw. bei Bedarf. Rechte und Hooks sitzen als Gatter auf den Werkzeugkanten. Die externe Welt liefert Dateien und Seiteneffekte. Der Evaluation Harness sagt bestanden oder nicht — nicht das Modell über sich selbst.

Die Schleife um das Modell

Ohne Laufzeit ist ein LLM ein Fortsetzer von Text. Mit Laufzeit wird daraus ein Agent: Das Modell schreibt strukturierte Werkzeugaufrufe; die Anwendung führt aus und legt das Ergebnis zurück. Genau das meint Function Calling. Die Vertrauensgrenze liegt im Host, nicht in den Gewichten.

Was die Laufzeit in jedem Schritt typischerweise tut:

  1. Kontext zusammensetzen: Systemhinweis, Rules, geladene Skills, Verlauf, Tool-Schemas, ggf. Datei-Ausschnitte.
  2. Ein oder mehrere Modelle aufrufen.
  3. Tool-Aufrufe parsen und gegen Rechte, Modi und Hooks prüfen.
  4. Ausführen und Beobachtungen anhängen.
  5. Stoppen, komprimieren oder ein Budget greifen lassen.

Anthropic nennt diese umgebende Software ausdrücklich agent harness (oder scaffold): Sie verarbeitet Eingaben, orchestriert Werkzeugaufrufe und liefert Ergebnisse. Wenn man „einen Agenten“ bewertet, bewertet man Laufzeit und Modell zusammen — Claude Code ist ein Beispiel für so eine flexible Harness. OpenAI beschreibt denselben Fortgang in der Agents-API: Nach Tool-Ergebnissen „continues the turn“ die Harness.

Agent-Profil

Ein Agent, Glossar, öffnet in neuem Tab ist hier keine neue Modellklasse. Es ist eine Konfiguration: Anweisungen (Persona, Ziele), erlaubte Werkzeuge, optional eigenes Modell, optional MCP-Server. Dieselbe Schleife, anderer Rahmen.

In der Praxis heißt das Artefakt unterschiedlich — der Kasten im Diagramm bleibt derselbe:

Kanonisch Typische Produktform
Agent-Profil OpenAI Agent(…) · Copilot .agent.md · Claude .claude/agents/ · Cursor-Subagent

Mehrere Profile oder Subagenten sind optional. Sie bekommen oft ein eigenes Kontextfenster und eine engere Tool-Liste und melden eine Zusammenfassung zurück. Das ist Routing und Isolation — kein zweites Gehirn. Multi-Agent-Frameworks bleiben eine spätere Produktschicht; die Kernfähigkeit ist weiterhin ein Modell in einer Werkzeugschleife.

Persistente Anweisungen

Modelle behalten zwischen Sitzungen kein zuverlässiges Projektgedächtnis in den Gewichten. Was sich wiederholt — Stil, Testbefehl, „keine Secrets in Logs“ — gehört in Dateien, die die Laufzeit oft oder immer in den Kontext legt.

Kanonisch Produktnamen (Beispiele)
Persistente Anweisungen / Rules Cursor Rules, AGENTS.md · CLAUDE.md, .claude/rules/ · Copilot Custom Instructions (.github/copilot-instructions.md, path-spezifisch, persönlich/org)

Das sind weiche Vorgaben: Das Modell sieht den Text und soll folgen. Es ist keine Durchsetzung. Claude Code sagt das klar: CLAUDE.md ist Kontext, keine erzwungene Konfiguration — Blockieren geht über Hooks und Rechte. Cursor sagt dasselbe für Rules: mit Enforcement-Hooks kombinieren.

Daueranweisungen kosten Tokens in jedem Lauf. Kurz, konkret, grounded — und Domain-Workflows eher in Skills auslagern. Unter KI-Nutzung steht die Praxisstufe dazu.

Skills

Skills, Glossar, öffnet in neuem Tab sind situative Ablaufpakete: ein Verzeichnis mit mindestens SKILL.md (Name, Beschreibung, Anleitung) und optional Skripten, Referenzen, Assets. Der offene Standard Agent Skills beschreibt progressive disclosure: Metadaten liegen bereit; der Körper wird erst bei Bedarf geladen; weitere Dateien folgen danach.

Rules Skills
Wann im Kontext oft immer oder pfadbasiert wenn relevant / manuell
Zweck stabile Konventionen wiederkehrende Workflows
Kosten dauernd gezielt

Skills sind keine Tools und kein MCP. Tools führen die Welt aus. Skills erklären dem Agenten wie ein Ablauf aussehen soll — und können dabei auf Tools verweisen. Cursor und Claude Code lesen dieselben SKILL.md-Konventionen; Copilot nutzt den Markennamen seltener und steuert über Instructions und Agent-Profile.

Host-Werkzeuge und MCP

Zwei Wege in dieselbe externe Welt:

  • Host-Werkzeuge baut das Produkt ein: Dateien lesen/schreiben, Shell, Browser, Git, eingebaute Suchen.
  • MCP, Glossar, öffnet in neuem Tab ist die Steckerleiste dazwischen: ein Host spricht mit Servern, die Tools, Resources und Prompts anbieten. MCP legt nicht fest, wie das LLM gesteuert wird — nur, wie Kontext und Fähigkeiten angebunden werden.

Beide landen im Diagramm als Kanten von der Laufzeit zur Welt. Ein aufgeblähter Tool-Katalog füllt dasselbe Working Memory, Glossar, öffnet in neuem Tab wie zu viele Dateien — siehe Context Rot, Glossar, öffnet in neuem Tab unter Problemen bei der Nutzung.

Fremde MCP-Server gehören geprüft wie fremde Pakete: Herkunft, Rechte, welche Daten abfließen.

Steuerung: Rechte, Modi, Hooks

Weiche Anweisungen reichen nicht, sobald Seiteneffekte möglich sind. Die harte Ebene sitzt im Diagramm als Gatter:

  • Rechte / Allowlists: welche Tools überhaupt, mit welcher Freigabe (nur lesen, Edit akzeptieren, nachfragen, …).
  • Mode, Glossar, öffnet in neuem Tab : ändert Policy und Workflow-Stufe, nicht die Definition von Skill oder Rule. Typisch: Plan zuerst (recherchieren, Plan reviewen, dann bauen) versus direkt Agent. Claude Code kennt Permission-Modi inkl. plan (lesen, nicht schreiben); Cursor kennt Plan Mode und Run Modes für Freigaben.
  • Hook, Glossar, öffnet in neuem Tab : deterministische Skripte am Lebenszyklus (vor Shell, vor MCP, vor Compact, am Stopp). Sie dürfen blockieren oder umbiegen, wo Rules nur bitten.

Ohne diese Ebene multipliziert Least Privilege, Glossar, öffnet in neuem Tab -Rhetorik nichts. Mit ihr bleibt Human Approval vor High-Impact möglich — und bypassPermissions-artige Schalter bewusst riskant.

Zwei Bedeutungen von Harness

Das Wort Harness, Glossar, öffnet in neuem Tab meint in der Praxis zwei verschiedene Kästen. Beide gehören ins Bild; sie sind nicht austauschbar.

Agent Harness — die Laufzeit

Die Software um das Modell: Kontext, Tool-Schleife, Rechte, Stoppbedingungen. Ohne sie gibt es keinen Agenten, nur Chat. Beispiele: Claude Code, Cursor Agent, OpenAI Runner um ein Agent-Objekt, Codex als workspace-bezogene Coding-Harness.

Evaluation Harness — der Prüfstand

Äußere Orakel, die schlechte Ausgabe falsifizieren: Tests, Build, Linter, CI, Simulationen, Telemetrie. Datadog formuliert „harness-first“ so: Das Modell erzeugt, der Harness prüft. Anthropic trennt in Eval-Texten dasselbe Wort noch einmal: eine evaluation harness führt Aufgaben aus und bewertet — das ist Cousin des Prüfstands, nicht dasselbe wie die Agent-Laufzeit.

Unter KI-Nutzung war „Tests und kleine Diffs sind der Evaluation Harness“ genau diese zweite Lesart. Eine starke Agent Harness ohne Evaluation Harness skaliert Fehler nur schneller. Eine starke Testplattform ohne Laufzeit ist klassische Entwicklung — beides zusammen ist die KI-Umgebung.

Was Diagramme oft weglassen

Stück Warum es zählt
Tool-Schemas im Kontext Die Laufzeit zeigt dem Modell die Kataloge; zu große Kataloge verschwenden Tokens.
Mehrere Modelle Plan/Explore günstig, Umsetzung teurer — „der Agent“ ist nicht eine Model-ID.
Speicherarten Sitzungsprotokoll ≠ Rules-Datei ≠ optionales Auto-Memory.
Budgets Tokens, Turns, Kosten — Agent-Schleifen sind teurer als ein kurzer Chat.
Observability Traces und Hooks machen Fehlschläge debuggbar und bewertbar.
Inner vs. outer Vendor-Laufzeit innen; Rules, Skills, MCP, CI außen dazugekauft.
Note
Anbieter-spezifisch, nicht nur ein Synonym: Claude Code kann ein Auto-Memory schreiben (vom Modell gepflegte Notizen neben CLAUDE.md). Cursor kann einen Skill als Custom Mode für die ganze Session im Kontext halten. Beides ist optionaler Zusatz zum kanonischen Bild — kein eigener Grundkasten für jede Umgebung.

Begriffstafel

Begriff Kanonisch hier Häufige Produktnamen
Agent Modell in Tool-Schleife Agent-Chat, Coding Agent, Subagent
Agent-Profil Persona + Tools (+ Modell/MCP) .agent.md, Agent(…), .claude/agents/
Agent Harness Laufzeit um das Modell „Agent“, Claude Code, Runner
Evaluation Harness Prüfstand / Orakel Tests, CI, /verify, Eval-Harness
Rules persistente weiche Anweisungen Rules, AGENTS.md, CLAUDE.md, Custom Instructions
Skill situatives Ablaufpaket SKILL.md, Skillsets
Tool vom Host ausgeführte Fähigkeit Shell, Edit, Browser, Function
MCP Steckerleiste Host ↔ Server mcp.json, MCP servers
Mode Policy / Workflow-Stufe Plan Mode, permission modes, Run Modes
Hook deterministisches Gatter hooks.json, PreToolUse

Was man davon mitnehmen sollte

  1. Die KI-Umgebung ist Modell + Laufzeit + Welt + Prüfstand — nicht die Chat-Box allein.
  2. Rules, Skills, Tools und MCP sind vier verschiedene Kästen.
  3. Weiche Anweisungen steuern Ton und Konvention; Hooks und Rechte steuern Schaden.
  4. Agent Harness und Evaluation Harness teilen ein Wort und zwei Jobs. Beide benennen.
  5. Produkt-UIs wechseln Namen. Das kanonische Diagramm bleibt die Landkarte; Synonyme gehören in die Tabelle, nicht als neue Architektur.

Quellen und Vertiefung

Note
Wer nur wenige Quellen will: Anthropic Demystifying evals (Agent- vs. Evaluation-Harness), Agent-Skills-Spezifikation, MCP Architecture, Cursor Rules/Skills/Hooks, Copilot Custom Instructions / Custom Agents, OpenAI Agents SDK.

Laufzeit und Harness

Anweisungen, Skills, Profile

MCP, Steuerung, Subagenten