Glossar für KI-Engineering
Verständliche Definitionen zu agentischer KI, Orchestrierung und Begriffen aus dem KI-Engineering. Ob du dein erstes Projekt mit einem KI-Agenten entwickelst oder ein bestehendes Projekt skalierst: Hier findest du alle benötigten Begriffe an einem Ort.
101 Begriffe gefunden
Keine Einträge gefunden.
A
A2A-Protokoll
Das A2A-Protokoll, kurz für Agent2Agent, ist ein offener Standard für die Kommunikation zwischen KI-Agenten, die von unterschiedlichen Teams auf unterschiedlichen Frameworks gebaut wurden. Es ermöglicht einem Agenten, die Fähigkeiten eines anderen zu entdecken, ihm eine Aufgabe zu übertragen und diese bis zum Abschluss zu verfolgen – ohne dass eine der beiden Seiten ihre internen Prompts, Modelle oder Tools offenlegen muss.
Agent-Orchestrierung
Agent-Orchestrierung ist die Koordination mehrerer KI-Agenten, die an Teilen einer größeren Aufgabe arbeiten: Arbeit zuweisen, Schritte in eine Reihenfolge bringen, Kontext zwischen Agenten weitergeben und Ergebnisse zu einem Output zusammenführen. Der Koordinator kann ein Lead-Agent sein, der dynamisch entscheidet, oder ein deterministischer Controller, der festen Routing-Regeln folgt.
Agentengedächtnis
Agentengedächtnis (Agent Memory) bezeichnet die Gesamtheit der Mechanismen, mit denen ein KI-Agent Informationen über ein einzelnes Kontextfenster hinaus behält und wiederverwendet: Sitzungszustand, in Dateien geschriebene Notizen, Datenbanken und Vektorspeicher. Es ist das, was einem Agenten erlaubt, Fakten, Präferenzen und Lektionen über Aufgaben hinweg mitzuführen, statt jede Sitzung bei null zu beginnen. Die Lücke, die es schließt, ist gut dokumentiert: Im LoCoMo-Benchmark für sehr lange Konversationen mit durchschnittlich 300 Turns über bis zu 35 Sitzungen fanden Maharana und Kollegen 2024 heraus, dass LLM-Agenten beim Erinnern früheren Kontexts deutlich hinter menschlicher Leistung zurückbleiben.
Agentenschwarm
Ein Agentenschwarm ist eine Gruppe von KI-Agenten, die parallel auf dasselbe Problem oder auf viele Teilstücke davon angesetzt werden, wobei ihre Ergebnisse anschließend zusammengeführt, gerankt oder per Abstimmung bewertet werden. Der Ansatz tauscht zusätzliche Rechenleistung und Tokens gegen breitere Abdeckung und höhere Zuverlässigkeit ein, als ein einzelner Agentenlauf liefern kann.
Agentische Automatisierung
Agentische Automatisierung (Agentic Automation) ist Geschäftsprozessautomatisierung, bei der KI-Agenten die Schritte übernehmen, die Urteilsvermögen erfordern – etwa das Interpretieren unübersichtlicher Eingaben, das Abwägen zwischen Optionen und das Reagieren auf Ausnahmefälle. Klassische regelbasierte Automatisierung führt feste Skripte aus und bricht, sobald Eingaben variieren; agentische Automatisierung passt sich an und eskaliert nur dann an Menschen, wenn eine Entscheidung ihr Mandat überschreitet. Die Einführung ist längst über Pilotprojekte hinaus: 46 % der Führungskräfte in Microsofts Work Trend Index 2025 gaben an, dass ihre Organisation KI-Agenten nutzt, um Workstreams oder Geschäftsprozesse vollständig zu automatisieren, angeführt von Kundenservice, Marketing und Produktentwicklung.
Agentische Design Patterns
Agentische Design Patterns (Agentic Design Patterns) sind wiederverwendbare Strukturen für den Bau von KI-Agentensystemen. Die vier zentralen sind Reflexion, Tool-Nutzung, Planung und Multi-Agenten-Kollaboration. Jedes Pattern beschreibt eine bewährte Art, Modellaufrufe, Tools und Kontrollfluss anzuordnen, und jedes wägt Autonomie, Kosten, Latenz und Zuverlässigkeit auf eine andere, vorhersehbare Weise gegeneinander ab.
Agentische KI
Agentische KI (Agentic AI) ist eine Klasse von KI-Systemen, die ein Ziel verfolgen, indem sie Schritte planen, über Tools Handlungen ausführen, die Ergebnisse beobachten und ihren Kurs anpassen – und das mit begrenzter menschlicher Steuerung. Anders als ein Modell, das eine Antwort auf einen Prompt liefert, arbeitet ein agentisches System weiter, bis das Ziel erreicht ist oder eine Abbruchbedingung greift. Die Obergrenze dieser Arbeitsfähigkeit steigt kontinuierlich: METR maß 2025, dass sich die Länge der Aufgaben, die KI-Agenten autonom abschließen können, in den letzten sechs Jahren etwa alle 7 Monate verdoppelt hat.
Agentischer Workflow
Ein agentischer Workflow ist ein mehrstufiger Prozess, bei dem KI-Agenten planen, Aktionen ausführen, Ergebnisse bewerten und Arbeit auf ein definiertes Ziel hin weitergeben. Er kombiniert modellgesteuerte Entscheidungen mit deterministischen Schritten wie Skripten, API-Aufrufen und Freigabe-Gates, sodass sich das System an das Vorgefundene anpassen kann und trotzdem vorhersehbare, überprüfbare Ergebnisse liefert. Die Obergrenze dessen, was solche Workflows bewältigen können, steigt kontinuierlich: METR hat 2025 gemessen, dass sich die Länge der Aufgaben, die führende Agenten mit einer Erfolgsquote von 50 % abschließen können, seit 2019 etwa alle 7 Monate verdoppelt hat, wobei Claude 3.7 Sonnet einen Zeithorizont von rund 50 Minuten erreicht.
Agentisches Coding
Agentisches Coding (Agentic Coding) ist die Praxis, Software zu erstellen, indem man einen KI-Coding-Agenten anleitet, der die Codebasis liest, Dateien bearbeitet, Befehle ausführt und die Ergebnisse iterativ verbessert – statt den Code selbst zu tippen. Der Entwickler liefert Absicht, Constraints und Review; der Agent liefert die Tastenanschläge. Die Praxis läuft bereits in echtem Umfang: GitHubs Octoverse-2025-Report zählte zwischen Mai und September 2025 über 1 Million Pull Requests, die von seinem Copilot-Coding-Agenten generiert wurden, konzentriert auf etablierte Repositories statt auf experimentelle Projekte.
Agentisches Engineering
Agentisches Engineering ist die Disziplin, KI-Agenten durch Spezifikationen, Guardrails und Review zum Bau von Software anzuleiten, statt jede Zeile von Hand zu schreiben. Die Aufgabe des Ingenieurs verschiebt sich vom Tippen von Code hin zum Definieren, wie "richtig" aussieht, zum Einschränken dessen, was der Agent tun darf, und zum Verifizieren dessen, was er produziert hat. Das Rohmaterial für diese Verschiebung ist bereits überall vorhanden: Die Stack-Overflow-Umfrage 2025 fand heraus, dass 84 % der Entwickler KI-Tools in ihrem Workflow nutzen oder planen zu nutzen, gegenüber 76 % im Jahr zuvor.
Agentisches RAG
Agentisches RAG ist Retrieval-Augmented Generation, bei der ein KI-Agent den Retrieval-Prozess steuert. Statt vor der Antwort eine einzige feste Suche auszuführen, entscheidet der Agent, ob überhaupt abgerufen werden soll, wählt zwischen Quellen, formuliert Anfragen neu, bewertet die Ergebnisse und sucht erneut, bis genügend Evidenz für eine gute Antwort vorliegt.
AGENTS.md
AGENTS.md ist eine einfache Markdown-Datei, die in einem Repository abgelegt wird, um KI-Coding-Agenten mitzuteilen, wie das Projekt funktioniert: Build- und Test-Befehle, Code-Konventionen, Architekturhinweise und einzuhaltende Regeln. Es handelt sich um eine herstellerneutrale Konvention, die oft als „README für Agenten" bezeichnet wird, und sie wird Stand 2026 von den meisten Coding-Agenten automatisch eingelesen.
Attention-Mechanismus
Ein Attention-Mechanismus ist die Komponente eines Transformer-Modells, die für jedes Token berechnet, wie stark jedes andere Token in der Sequenz es beeinflussen soll. Diese gelernten Relevanz-Scores sind, wie Sprachmodelle Referenzen auflösen, Struktur verfolgen und Kontext nutzen, und ihre Kosten sind der Grund, warum lange Prompts teuer sind. Die Idee erwies sich als stark genug, um allein zu bestehen: Das Paper "Attention Is All You Need" von 2017 verzichtete vollständig auf Rekurrenz und Convolutions und setzte trotzdem mit 41,8 BLEU einen Einzelmodell-State-of-the-Art bei WMT 2014 Englisch-Französisch-Übersetzung.
Automatisierungsbias
Automatisierungsbias ist die menschliche Tendenz, Output eines automatisierten Systems mehr zu vertrauen, als die Evidenz rechtfertigt — die Antwort einer Maschine mit weniger Prüfung zu akzeptieren, als dieselbe Behauptung von einer Person bekäme. In KI-unterstütztem Engineering zeigt sie sich darin, agenten-geschriebenen Code, Configs und Analysen weitgehend zu genehmigen, weil sie vollständig, selbstbewusst und professionell formatiert ankommen. Das Vertrauen von Entwickelnden ist in beide Richtungen schlecht kalibriert: In der Stack-Overflow-Umfrage 2025 vertrauten nur 33 % der Entwickler der Genauigkeit von KI-Output, nur 3 % vertrauten stark, und 46 % misstrauten aktiv, dennoch nutzten 51 % der professionellen Entwickler KI-Tools täglich.
Autonomer KI-Agent
Ein autonomer KI-Agent ist ein KI-Agent, der mehrstufige Ziele durchgängig erledigt, ohne dass ein Mensch jede Aktion genehmigt. Sicherheit kommt aus im Voraus gesetzten Einschränkungen wie begrenzten Berechtigungen, Budgets und Guardrails, plus Review des fertigen Ergebnisses, statt aus Aufsicht während des Laufs. Wie viel man einem Agenten sicher übergeben kann, wächst stetig: METR fand 2025, dass sich die Länge von Aufgaben, die Frontier-Agenten mit 50 % Zuverlässigkeit erledigen können, seit sechs Jahren etwa alle 7 Monate verdoppelt.
B
Browser-Agent
Ein Browser-Agent ist ein KI-Agent, dessen primäres Tool ein Webbrowser ist. Mit einem Ziel navigiert er Seiten, liest Inhalte, klickt Elemente, füllt Formulare aus und erledigt mehrstufige Abläufe so, wie es eine Person täte, was ihm erlaubt, jede Website zu bedienen, einschließlich der großen Mehrheit, die keine API bereitstellt. Zuverlässigkeit im offenen Web bleibt der schwierige Teil: Bei WebArenas realistischen Aufgaben rund um E-Commerce, Foren, Code-Hosting und CMS-Arbeit erledigte der beste GPT-4-Agent in der Carnegie-Mellon-Studie von 2023 14,41 % der Aufgaben durchgängig, verglichen mit 78,24 % bei Menschen.
C
Chain-of-Thought-Prompting
Chain-of-Thought-Prompting ist die Technik, ein Sprachmodell anzuweisen, sich Schritt für Schritt durch ein Problem zu arbeiten, bevor es seine finale Antwort gibt, statt sofort zu antworten. Das explizite Sichtbarmachen des Zwischen-Reasonings verbessert messbar die Genauigkeit bei Mathematik, Logik, Planung und mehrstufigen Aufgaben, und es hinterlässt eine sichtbare Spur, die Sie prüfen können, wenn die Antwort falsch ist. Im ursprünglichen Paper von Wei et al. bei Google aus dem Jahr 2022 erreichte ein 540B-Parameter-Modell mit nur acht Chain-of-Thought-Beispielen State-of-the-Art-Genauigkeit auf dem GSM8K-Mathe-Benchmark und schlug damit sogar ein feingetuntes GPT-3 mit Verifier.
CLAUDE.md
CLAUDE.md ist die Markdown-Instruktionsdatei, die Claude Code, Anthropics Coding-Agent, automatisch zu Beginn jeder Sitzung liest. Sie trägt dauerhaften Projektkontext: Build- und Testbefehle, Code-Konventionen, Architekturnotizen und Regeln, die der Agent befolgen muss, sodass dieselbe Anleitung für jede Aufgabe gilt, ohne in Prompts wiederholt zu werden.
Code-LLM
Ein Code-LLM ist ein Large Language Model, das primär auf Quellcode trainiert oder feingetunt wurde, optimiert, um Programme zu generieren, zu vervollständigen, zu erklären und zu reparieren. Der Begriff umfasst dedizierte Code-Modelle und, zunehmend, generelle Frontier-Modelle, deren Training stark auf Code gewichtet wurde, weil Programmieren zu ihrer kommerziell wichtigsten Fähigkeit wurde.
Computer Use
Computer Use ist eine KI-Agenten-Fähigkeit, bei der das Modell einen Computer über seine grafische Oberfläche bedient: Es betrachtet Screenshots, bewegt den Cursor, klickt, tippt und scrollt, genau wie es eine Person täte. Das erlaubt einem Agenten, mit jeder Anwendung auf dem Bildschirm zu arbeiten, einschließlich Software, die keine API für strukturierten Zugriff bietet.
Context Engineering
Context Engineering ist die Disziplin, alles zu kontrollieren, was ein KI-Modell zur Inferenzzeit sieht: welche Dateien, Dokumente, Konversationsverläufe, Anweisungen und Tool-Ergebnisse in das Context Window gelangen, in welcher Form und in welcher Reihenfolge. Wo Prompt Engineering eine einzelne Anweisung formt, verwaltet Context Engineering das gesamte Sichtfeld des Modells über eine langlaufende Aufgabe hinweg.
Context Rot
Context Rot ist die allmähliche Verschlechterung der Output-Qualität eines Sprachmodells, während sich sein Context Window über eine lange Sitzung hinweg mit veralteter, widersprüchlicher oder irrelevanter Information füllt. Das Modell beginnt, alte Anweisungen mit aktuellen zu verwechseln, verworfene Ansätze zu wiederholen und den Überblick darüber zu verlieren, was tatsächlich zählt, obwohl sich am Modell selbst nichts geändert hat.
D
Data Poisoning
Data Poisoning ist ein Angriff, der die Daten korrumpiert, aus denen ein KI-System lernt oder die es abruft, sodass das Modell vom Angreifer gewähltes Verhalten übernimmt: versteckte Hintertüren, verschlechterte Genauigkeit oder eingeschleuste Falschinformationen. Es handelt sich um einen Supply-Chain-Angriff auf die Datenebene, der Pretraining-Korpora, Fine-Tuning-Datensätze oder die Dokumente ins Visier nehmen kann, denen eine RAG-Pipeline vertraut.
E
F
Few-Shot-Prompting
Few-Shot-Prompting ist die Technik, eine kleine Anzahl ausgearbeiteter Input-Output-Beispiele direkt in den Prompt aufzunehmen, damit das Modell das gewünschte Muster ableitet und auf neue Eingaben anwendet. Es lehrt durch Vorführung statt durch Beschreibung, und es ist kein Training oder Fine-Tuning beteiligt: Die Beispiele leben allein im Prompt selbst.
Foundation Model
Ein Foundation Model ist ein großes KI-Modell, das einmal auf breiten Daten in großem Maßstab trainiert und anschließend durch Prompting, Fine-Tuning oder Tool-Integration an viele nachgelagerte Aufgaben angepasst wird. Statt für jede Aufgabe ein eigenes Modell zu bauen, bauen Teams Produkte auf einer gemeinsamen Basis auf – das ist das ökonomische Muster, das der gesamten heutigen KI-Industrie zugrunde liegt.
Frontier Model
Ein Frontier Model ist ein KI-Modell an der aktuellen Fähigkeitsgrenze: eines der wenigen Systeme, die zu einem gegebenen Zeitpunkt den Stand der Technik definieren. Der Begriff markiert eine sich verschiebende Grenze statt einer festen Spezifikation, und er dient zugleich als regulatorische Kategorie, da Sicherheits-Frameworks und Compute-Schwellenwert-Regeln genau auf diese Klasse abzielen.
G
H
Human-in-the-Loop
Human-in-the-Loop ist ein Workflow-Design, bei dem ein KI-System die Arbeit erledigt, aber ein Mensch die wichtigen Entscheidungen prüft und freigibt, bevor sie wirksam werden. Die KI übernimmt Volumen und Geschwindigkeit; der Mensch liefert Urteilsvermögen, Verantwortlichkeit und ein Vetorecht an den Stellen, an denen Fehler teuer oder irreversibel sind. Das Muster hält sich auch deshalb, weil Vertrauen Grenzen hat: Die DORA-Umfrage 2025 fand heraus, dass 30 % der Technologiefachleute wenig oder gar kein Vertrauen in KI-generierten Code haben – ein zentraler Grund, warum menschliche Prüfung ein Standard-Kontrollpunkt bleibt.
I
J
K
KI-Agent
Ein KI-Agent ist ein Softwaresystem, das ein Sprachmodell nutzt, um zu entscheiden, was als Nächstes zu tun ist, und dann durch Tools wie APIs, Dateien, eine Shell oder einen Browser handelt. Es beobachtet das Ergebnis jeder Aktion und iteriert weiter, bis das Ziel erreicht ist, gescheitert ist oder an eine Person zurückgegeben wird. Die Nachfrage nach solchen Systemen ist breit: 82 % der Führungskräfte in Microsofts 2025 Work Trend Index erwarten, digitale Arbeitskraft wie KI-Agenten zu nutzen, um ihre Belegschaft innerhalb von 12 bis 18 Monaten zu erweitern.
KI-Agenten-Evaluierung
KI-Agenten-Evaluierung ist die Praxis zu messen, ob ein KI-Agent Aufgaben durchgängig korrekt abschließt, wobei die gesamte Abfolge von Entscheidungen, Tool-Aufrufen und Zwischenschritten ebenso bewertet wird wie das Endergebnis. Sie erweitert die Bewertung einzelner Antworten auf mehrstufige autonome Arbeit, bei der ein Agent über einen fehlerhaften Prozess zur richtigen Antwort gelangen oder zehn Schritte nach einem guten Start scheitern kann. Der Einsatz steigt stetig, weil Agenten immer leistungsfähiger werden: METR maß 2025, dass Frontier-Modelle wie Claude 3.7 Sonnet einen Zeithorizont von etwa 50 Minuten bei 50 Prozent Erfolgsquote erreichen – ein Horizont, der sich seit 2019 etwa alle sieben Monate verdoppelt hat.
KI-Agenten-Framework
Ein KI-Agenten-Framework ist eine Softwarebibliothek, die die Bausteine für die Erstellung von KI-Agenten liefert: Modellaufrufe, Tool-Definitionen, Gedächtnis, State Management und die Schleife, die es einem Agenten erlaubt zu planen, zu handeln und Ergebnisse zu beobachten. Entwickler setzen diese Komponenten zusammen, statt die Agentenschleife für jedes Projekt von Grund auf neu zu verdrahten. Die Zielgruppe für dieses Tooling ist bereits groß: In LangChains State-of-AI-Agents-Umfrage 2024 unter mehr als 1.300 Fachleuten hatten 51 % Agenten in Produktion, bei mittelgroßen Unternehmen mit 100 bis 2.000 Mitarbeitenden stieg der Anteil auf 63 %.
KI-Agenten-Sicherheit
KI-Agenten-Sicherheit ist die Praxis, Systeme vor den Risiken zu schützen, die entstehen, wenn KI-Agenten autonom handeln: dem Befolgen von in Daten versteckten, eingeschleusten Anweisungen, der Nutzung zu weitreichender Berechtigungen, der Installation halluzinierter Abhängigkeiten oder dem Ausrollen ungeprüfter Änderungen in die Produktion. Sie kombiniert klassische Zugriffskontrolle mit Abwehrmaßnahmen, die speziell darauf zugeschnitten sind, wie sich Sprachmodelle manipulieren lassen.
KI-Agentenarchitektur
KI-Agentenarchitektur ist der strukturelle Aufbau eines Agentensystems: das Sprachmodell als Kern, die Tool-Schicht, über die es handelt, das Gedächtnis, das es dauerhaft speichert, die Schleife, die Planung und Ausführung antreibt, die Guardrails, die sein Verhalten begrenzen, sowie die Verbindungen, die aus diesen Teilen ein funktionierendes Gesamtsystem machen. Genau in diesem strukturellen Feinschliff liegt der Fortschritt des Feldes: Stanfords AI Index 2025 verzeichnete einen Anstieg der SWE-bench-Werte um 67,3 Prozentpunkte innerhalb eines einzigen Jahres, während agentische Systeme reiften.
KI-Alignment
KI-Alignment ist das Forschungsfeld, das sich damit beschäftigt, KI-Systeme dazu zu bringen, zuverlässig die Ziele zu verfolgen, die ihre Betreiber tatsächlich beabsichtigen, statt Ersatzziele, Schlupflöcher oder wörtliche Lesarten einer Anweisung. Je fähiger Modelle werden und je autonomer sie handeln, desto mehr wird die Lücke zwischen dem, worum gebeten wurde, und dem, was gemeint war, zu einem Sicherheits- und Zuverlässigkeitsproblem.
KI-Code-Dokumentation
KI-Code-Dokumentation ist die Praxis, Dokumentation — einschließlich Kommentare, READMEs, API-Referenzen und Architekturnotizen — mit KI-Modellen zu erzeugen und zu pflegen, die den Quellcode direkt lesen. Weil die Dokumentation aus dem Code selbst abgeleitet wird, kann sie jederzeit neu generiert werden, wenn sich der Code ändert, was das älteste Problem der Dokumentation angreift: die Drift zwischen dem, was die Doku sagt, und dem, was der Code tut. Entwickelnde haben das schneller angenommen als fast jede andere KI-Nutzung: In der Stack-Overflow-Entwicklerumfrage 2025 gaben 30,8 % an, KI überwiegend zur Dokumentation von Code zu nutzen, weitere 30,3 % nutzen sie teilweise.
KI-Code-Refactoring
KI-Code-Refactoring ist der Einsatz von KI-Coding-Agenten, um bestehenden Code umzustrukturieren, ohne sein Verhalten zu verändern: Umbenennen, Extrahieren von Funktionen, Aufteilen überdimensionierter Module und Migration veralteter Muster über eine gesamte Codebasis hinweg. Die Testsuite definiert das Verhalten, das erhalten bleiben muss, der Agent führt die mechanischen Änderungen aus, und ein Mensch prüft das Ergebnis, bevor es gemergt wird.
KI-Code-Review
KI-Code-Review ist der Einsatz eines großen Sprachmodells, um Codeänderungen auf Bugs, Sicherheitsprobleme, Logikfehler und Stilprobleme zu untersuchen – typischerweise als automatisierter erster Durchgang bei Pull Requests. Es ergänzt das menschliche Review, indem es mechanische Mängel frühzeitig abfängt, sodass Menschen sich auf die Beurteilung von Architektur, Absicht und Eignung für den Zweck konzentrieren können.
KI-Codegenerierung
KI-Codegenerierung ist die Erstellung von Quellcode durch ein Machine-Learning-Modell auf Basis von Beschreibungen in natürlicher Sprache, vorhandenem Code oder einer Kombination aus beidem. Sie reicht von einzeiligen Autocomplete-Vorschlägen bis zu ganzen Anwendungen, die von autonomen Agenten gebaut werden, und ist 2026 für einen großen Teil professioneller Software zum Standardmechanismus für den ersten Entwurf geworden. Die Nachfrage zeigt sich bereits in der Modellnutzung selbst: Der Anthropic Economic Index fand heraus, dass 37,2 % der an Claude gesendeten Anfragen in die Kategorie „Computer und Mathematik" fielen, die Aufgaben wie Codeänderungen und Debugging umfasst – damit ist Coding die mit Abstand größte Nutzungsart des Modells.
KI-Coding-Agent
Ein KI-Coding-Agent ist Software, die eine Entwicklungsaufgabe in natürlicher Sprache entgegennimmt, dann die Codebasis liest, Dateien schreibt und bearbeitet, Befehle ausführt und die Ergebnisse so lange iteriert, bis die Aufgabe erledigt ist. Er arbeitet mit weit mehr Autonomie als Autocomplete im Editor und schließt ganze Arbeitseinheiten ab, statt nur die nächste Zeile vorzuschlagen. Die Kategorie ist schnell gereift: Als der SWE-bench-Benchmark 2023 startete, löste das beste Modell nur 1,96 % der echten GitHub-Issues aus 12 populären Python-Repositories.
KI-Coding-Assistent
Ein KI-Coding-Assistent ist ein Werkzeug, das Entwicklern beim Schreiben von Software hilft, indem es Vorschläge generiert, Code vervollständigt und Fragen direkt im Editor beantwortet – angetrieben von einem großen Sprachmodell. Der Entwickler behält die Kontrolle über jede Änderung, was Assistenten von autonomen Agenten unterscheidet, die Dateien selbstständig bearbeiten und Befehle ausführen. Die Verbreitung ist groß: In JetBrains' 2025er-Umfrage unter 24.534 Entwicklern aus 194 Ländern nutzten 85 % regelmäßig KI-Tools zum Programmieren, und 62 % verließen sich auf mindestens einen KI-Coding-Assistenten, -Agenten oder KI-Code-Editor.
KI-DevOps
KI-DevOps ist der Einsatz von KI-Agenten in der Software-Delivery-Pipeline: Diagnose von CI-Fehlschlägen, Review von Infrastrukturänderungen, Verwaltung von Deployments und Durchführung des ersten Durchgangs der Incident Response. Software, die Logs lesen, Dashboards abfragen und Befehle ausführen kann, übernimmt die operative Routinearbeit, die früher Engineers unterbrochen hat, während Menschen die Freigabe über alles behalten, was die Produktion berührt. Der Wandel ist bereits Mainstream: 75 % der Befragten der DORA-Umfrage 2024 gaben an, sich für mindestens eine tägliche berufliche Aufgabe auf KI zu verlassen, und im DORA-Report 2025, der auf fast 5.000 Technologie-Fachkräften basiert, gaben 90 % an, KI bei der Arbeit zu nutzen, wobei mehr als 80 % sagten, sie habe ihre Produktivität gesteigert.
KI-Governance
KI-Governance ist die Gesamtheit der Richtlinien, Rollen und Kontrollen, mit denen eine Organisation KI verantwortungsvoll einsetzt: Sie legt fest, welche Anwendungen erlaubt sind, wer für welches System verantwortlich ist, wie Daten und Risiken gesteuert werden und wie Compliance nachgewiesen wird. Sie macht aus verstreuter KI-Nutzung etwas, das die Organisation tatsächlich sehen, steuern und verteidigen kann. Der Bedarf wächst: Gemeldete KI-bezogene Vorfälle stiegen 2024 auf einen Rekordwert von 233 – ein Anstieg von 56,4 % gegenüber 2023 –, laut den Zahlen der AI Incidents Database im AI Index von Stanford.
KI-Grounding
KI-Grounding ist die Praxis, den Output eines Modells an überprüfbare Quellen zu binden — etwa abgerufene Dokumente, Datenbankeinträge oder Tool-Ergebnisse —, sodass jede Behauptung nachverfolgt und geprüft werden kann. Eine geerdete Antwort zitiert, woher ihre Fakten stammen; eine ungeerdete Antwort verlässt sich nur darauf, was das Modell während des Trainings aufgenommen hat.
KI-Guardrails
KI-Guardrails sind die technischen Kontrollen, die um ein KI-System herum platziert werden, um dessen Verhalten innerhalb akzeptabler Grenzen zu halten: Input- und Output-Filter, eingeschränkte Berechtigungen, Validierungsprüfungen, sandboxed Ausführung und verpflichtende Freigabe-Gates vor folgenreichen Aktionen. Sie gehen davon aus, dass das Modell manchmal falschliegen oder manipuliert werden wird, und begrenzen den Schaden, wenn das passiert.
KI-Halluzination
Eine KI-Halluzination ist ein selbstbewusster Output eines Modells, der sachlich falsch oder komplett erfunden ist: eine Funktion, die es in der Bibliothek nicht gibt, ein Parameter, den die API nie akzeptiert hat, ein Paket, das niemand veröffentlicht hat, ein Zitat aus einem nie geschriebenen Paper. Der Output ist flüssig und plausibel, und genau das macht ihn gefährlich. Das Problem ist im großen Maßstab messbar: Eine Stanford-Studie von 2024 fand, dass LLMs bei 58 Prozent (ChatGPT) bis 88 Prozent (Llama 2) überprüfbarer Fragen zu zufälligen Bundesgerichtsfällen halluzinierten.
KI-IDE
Eine KI-IDE ist eine Entwicklungsumgebung, die von Grund auf um KI-Fähigkeiten herum konzipiert ist: codebasis-bewusster Chat, prädiktives Multi-Datei-Editing und integrierte Agentenmodi sind Kernfunktionen und keine nachträglich aufgesetzten Plugins. Der Editor behandelt das Modell als vollwertigen Mitarbeiter mit Zugriff auf genau das Projekt, das auch der Entwickler sieht. Die übergeordnete Kategorie ist inzwischen Mainstream: 62 % der Entwickler nutzen mindestens einen KI-Coding-Assistenten, -Agenten oder -Code-Editor, so JetBrains' Umfrage 2025 unter 24.534 Entwicklern.
KI-Inferenz
KI-Inferenz bezeichnet das Ausführen eines trainierten Modells zur Erzeugung von Ausgaben: die Berechnung, die jedes Mal abläuft, wenn eine Anwendung einen Prompt sendet und eine Antwort erhält. Training baut das Modell einmalig auf; Inferenz ist die danach wiederkehrende Arbeitslast, um die sich API-Preise, Latenzbudgets und die GPU-Serving-Infrastruktur drehen. Diese Arbeitslast wächst in erstaunlichem Tempo: Google berichtete, das monatliche Inferenzvolumen sei innerhalb eines Jahres um das 50-Fache gestiegen, von 9,7 Billionen Token pro Monat auf über 480 Billionen bis Mai 2025.
KI-Observability
KI-Observability ist die Praxis, KI-Systeme in Produktion zu instrumentieren und dabei Traces, Prompts, Tool-Aufrufe, Token-Kosten, Latenz und Qualitätssignale zu erfassen, damit Teams sehen können, was ein Modell oder ein Agent tatsächlich getan hat und warum. Sie erweitert klassische Observability auf Systeme, deren Verhalten probabilistisch ist und deren Fehler selten eine Exception auslösen. Die Branche hat dieses Argument weitgehend akzeptiert: Fast 89 Prozent der Organisationen, die Agenten bauen, haben dafür Observability implementiert, so LangChains Umfrage unter mehr als 1.300 Fachleuten Ende 2025.
KI-Pair-Programming
KI-Pair-Programming bedeutet, beim Schreiben von Software durchgehend mit einem KI-Modell als Kollaborator zusammenzuarbeiten: Ansätze diskutieren, Code generieren und kritisieren, Entscheidungen laufend überprüfen. Es spiegelt die Rollen von Driver und Navigator aus dem menschlichen Pair-Programming, wobei die KI je nach Aufgabe beide Rollen einnehmen kann.
KI-Red-Teaming
KI-Red-Teaming ist die Praxis, das eigene KI-System gezielt anzugreifen – mit Jailbreaks, Injection-Payloads und Missbrauchsszenarien –, um Schwachstellen zu finden, bevor es echte Angreifer oder Nutzer tun. Es überträgt die adversariale Denkweise klassischer Security-Red-Teams auf das Modellverhalten und deckt sowohl böswillige Angriffe als auch ganz gewöhnliche Eingaben ab, die schädliche Ausgaben erzeugen.
KI-Sandbox
Eine KI-Sandbox ist eine isolierte Ausführungsumgebung, in der ein KI-Agent Code ausführen, Pakete installieren und Dateien ändern kann, ohne Produktionssysteme, echte Zugangsdaten oder die Host-Maschine anzurühren. Was immer der Agent kaputt macht, bleibt innerhalb dieser Grenze – das macht autonome Arbeit sicher genug, um sie im großen Maßstab zu delegieren.
KI-Slop
KI-Slop bezeichnet minderwertige, in hoher Menge von KI erzeugte Inhalte, die ohne nennenswertes menschliches Urteilsvermögen veröffentlicht oder ausgeliefert werden. Der Begriff umfasst gleichermaßen Artikel, Bilder, Code und Pull Requests: Ausgaben, die flüssig genug wirken, um auf den ersten Blick durchzugehen, aber Rauschen statt Wert hinzufügen – das sichtbare Symptom von Automatisierung, die ohne dahinterliegenden Review-Prozess läuft.
KI-Sycophancy
KI-Sycophancy ist die Tendenz eines Sprachmodells, Nutzenden zu sagen, was sie hören wollen, statt was wahr ist: geäußerten Meinungen zuzustimmen, fehlerhafte Pläne zu bestätigen und korrekte Antworten unter Widerspruch umzukehren. Sie entsteht durch Preference-Training, bei dem Modelle lernen, dass zustimmende Antworten höhere menschliche Bewertungen erhalten als akkurate.
KI-Testing
KI-Testing umfasst zwei verwandte Praktiken: den Einsatz von KI-Modellen, um Software-Tests zu generieren, auszuführen und zu pflegen, und das Testen von KI-Systemen selbst, deren Outputs von Lauf zu Lauf variieren und sich klassischen Pass-Fail-Assertions widersetzen. Beide zielen auf dasselbe Ziel ab — Fehler abzufangen, bevor Nutzende es tun —, aber jede verlangt andere Techniken, weil deterministische und probabilistische Software auf unterschiedliche Weise scheitert.
KI-unterstütztes Coding
KI-unterstütztes Coding ist eine Arbeitsweise, bei der Entwickelnde Software mit fortlaufender Hilfe von KI schreiben — durch Autocomplete, Inline-Edits und Chat —, während sie Autor jeder Änderung bleiben. Der Mensch steuert; das Modell beschleunigt. Das unterscheidet es von agentischem Coding, bei dem ein Agent ganze Aufgaben eigenständig ausführt. Die Praxis ist inzwischen die Norm statt die Ausnahme: In der Stack-Overflow-Umfrage 2025 unter mehr als 49.000 Entwicklern nutzten 84 % KI-Tools oder planten dies, gegenüber 76 % im Jahr 2024 — selbst während der Anteil derer, die der Genauigkeit von KI-Output misstrauen, von 31 % auf 46 % stieg.
Kontextfenster
Ein Kontextfenster ist die maximale Textmenge, die ein KI-Modell in einer einzelnen Anfrage verarbeiten kann, gemessen in Token – dazu gehören System-Prompt, Gesprächsverlauf, abgerufene Dokumente, Tool-Ergebnisse und die eigene Ausgabe des Modells. Es fungiert als Arbeitsgedächtnis des Modells: Alles, was darin enthalten ist, kann die Antwort beeinflussen – alles außerhalb existiert für das Modell schlicht nicht.
KV-Cache
Der KV-Cache ist der Speicher, in dem ein Transformer-Sprachmodell die Attention-Keys und -Values ablegt, die es für vorherige Token bereits berechnet hat. Durch deren Wiederverwendung erzeugt das Modell jedes neue Token, ohne die gesamte Eingabe erneut zu verarbeiten – das macht die Token-für-Token-Generierung schnell und lange Kontexte speicherintensiv teuer.
L
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf enormen Textmengen trainiert wird, um das nächste Token in einer Sequenz vorherzusagen. Bei ausreichender Skalierung erzeugt dieses einzige Ziel eine breite Fähigkeit zu schreiben, zusammenzufassen, zu argumentieren und Code zu generieren – weshalb LLMs Chat-Assistenten, Coding-Agenten und die meisten modernen KI-Produkte antreiben. Die Verbreitung spiegelt diese Reichweite: In der Stack-Overflow-Umfrage 2025 gaben 84 % der Entwickler an, KI-Tools bei der Arbeit zu nutzen oder dies zu planen, gegenüber 76 % im Vorjahr.
LLM-as-a-Judge
LLM-as-a-Judge ist eine Evaluationstechnik, bei der ein Sprachmodell die Ausgabe eines anderen Modells anhand eines schriftlichen Kriterienkatalogs bewertet und Eigenschaften wie Korrektheit, Hilfsbereitschaft oder Treue zur Quelle einstuft. Sie macht qualitative Evaluation günstig und schnell genug, um bei jeder Änderung zu laufen, um den Preis, die Verzerrungen und blinden Flecken des Richter-Modells selbst zu übernehmen. Die Technik gewann 2023 an Glaubwürdigkeit, als Zheng et al. zeigten, dass GPT-4 als Richter mit über 80 Prozent Übereinstimmung mit menschlichen Präferenzen auf MT-Bench und Chatbot Arena abschnitt – dasselbe Maß an Übereinstimmung, das Menschen untereinander erreichen.
LLM-Benchmark
Eine Orientierungskarte der Namen, die 2026 in Modellkarten immer wiederkehren. Wissen und Reasoning: MMLU und sein schwierigerer Nachfolger MMLU-Pro, GPQA für wissenschaftliche Fragen auf Graduiertenniveau, konzipiert, um Web-Nachschlagen zu widerstehen, und ARC-AGI für abstraktes Reasoning, das gegenüber Auswendiglernen widerstandsfähig bleibt. Mathematik: GSM8K (längst gesättigt, inzwischen ein Mindestcheck) und wettbewerbsstarke Sätze wie AIME-Aufgaben. Coding: HumanEval und MBPP für kurze Funktionsvervollständigung, beide praktisch gelöst, und SWE-bench mit seinen Varianten als Repository-skaliger Standard, bei dem ein Agent echte GitHub-Issues gegen versteckte Tests lösen muss. Agentisch und Tool-Use: Terminal-Aufgaben-Suiten, Web-Navigations-Benchmarks wie WebArena-Nachfolger und Genauigkeits-Suiten für Tool-Aufrufe. Präferenz und Gesamteindruck: Arena-artige Human-Vote-Leaderboards, wertvoll, um Qualitäten einzufangen, die statische Suiten übersehen, aber verzerrt zugunsten selbstbewusster, gut formatierter Antworten. Long-Context-Suiten runden das Bild ab, indem sie Abruf und Reasoning über große Kontextfenster hinweg testen statt nur Needle-in-Haystack-Retrieval.
LLM-Evals
LLM-Evals sind wiederholbare, automatisierte Tests, die messen, ob die Ausgabe eines Sprachmodells einen definierten Qualitätsstandard erfüllt: Korrektheit, Tonalität, Sicherheit, Format, Aufgabenerfüllung. Während Unit-Tests prüfen, ob Code sich deterministisch verhält, bewerten Evals probabilistische Ausgaben anhand eines Maßstabs – so können Teams Prompts und Modelle ändern, ohne raten zu müssen, ob sich die Qualität verändert hat.
LLM-Fine-Tuning
LLM-Fine-Tuning bezeichnet die Praxis, das Training eines vortrainierten Sprachmodells auf einem kleineren, aufgabenspezifischen Datensatz fortzusetzen, sodass sich sein Standardverhalten in Richtung dieser Aufgabe verschiebt. Anders als Prompting oder Retrieval, die das Modell zum Zeitpunkt der Anfrage steuern, verändert Fine-Tuning die Gewichte selbst und erzeugt so eine spezialisierte Variante des Basismodells.
LLM-Jailbreak
Ein LLM-Jailbreak ist eine Eingabe, die so gestaltet ist, dass ein Sprachmodell sein Sicherheitstraining ignoriert und Ausgaben erzeugt, die es eigentlich verweigern sollte. Die Techniken reichen von fiktiven Rollenspiel-Rahmungen über codierte Payloads bis hin zu langer Manipulation über mehrere Gesprächsrunden – und sie sind für Entwickler relevant, weil jedes eingesetzte Modell die Jailbreak-Angriffsfläche seines Basismodells erbt.
LLM-Quantisierung
LLM-Quantisierung ist der Prozess, die Gewichte eines Sprachmodells mit geringerer numerischer Präzision zu speichern – zum Beispiel als 4-Bit-Integer statt als 16-Bit-Gleitkommazahlen –, sodass das Modell weniger Speicher benötigt und schneller läuft. Gut umgesetzt senkt das die Hardwareanforderungen um die Hälfte bis drei Viertel, bei nur geringem Verlust an Ausgabequalität.
LLM-Streaming
LLM-Streaming ist die schrittweise Auslieferung der Antwort eines Sprachmodells, Token für Token, während sie erzeugt wird, statt auf die vollständige Fertigstellung zu warten. Es macht aus einer Antwort, die viele Sekunden zum Fertigstellen braucht, eine, die fast sofort zu erscheinen beginnt – weshalb nahezu jede Chat- und Agenten-Oberfläche darauf setzt.
LLM-Temperatur
Die LLM-Temperatur ist ein Sampling-Parameter, der steuert, wie zufällig die Ausgabe eines Sprachmodells ist. Bei niedriger Temperatur wählt das Modell fast immer sein wahrscheinlichstes nächstes Token, was konsistente, vorhersagbare Antworten liefert. Bei hoher Temperatur samplet es freier aus weniger wahrscheinlichen Token, was zu abwechslungsreichen und manchmal überraschenden Ausgaben führt.
LLM-Token
Ein LLM-Token ist die Einheit, in der ein Sprachmodell Text liest und schreibt: ein kurzer Zeichenabschnitt, im Durchschnitt etwa drei Viertel eines englischen Worts. Token sind zudem die Abrechnungseinheit jeder Modell-API, weshalb die Token-Anzahl sowohl bestimmt, was in eine Anfrage passt, als auch, was jede Anfrage kostet.
llms.txt
llms.txt ist ein vorgeschlagener Webstandard: eine Markdown-Datei im Root-Pfad einer Website (/llms.txt), die großen Sprachmodellen eine kuratierte Übersicht der wichtigsten Inhalte der Website liefert, mit Links zu bereinigten, markdown-freundlichen Versionen der wichtigsten Seiten. Er existiert, weil HTML-Seiten voller Navigation und Skripte den begrenzten Kontext eines KI-Systems verschwenden.
M
Mixture of Experts
Mixture of Experts (MoE) ist eine neuronale Netzwerkarchitektur, bei der jedes Token nur eine kleine Teilmenge der Modellparameter aktiviert, ausgewählt durch einen gelernten Router. Das Modell kann eine sehr große Gesamtparameterzahl halten, während es pro Anfrage die Rechenleistung eines weit kleineren Modells aufwendet, was die Inferenzkosten senkt.
Model Card
Eine Model Card ist ein strukturiertes Offenlegungsdokument, das zusammen mit einem KI-Modell veröffentlicht wird und beschreibt, was das Modell ist, wie es trainiert wurde, worin es gut ist, wo es versagt, und welche Sicherheitsevaluationen es bestanden hat. Sie gibt Ingenieuren die Information, die sie brauchen, um zu entscheiden, ob ein Modell zu ihrem Anwendungsfall passt.
Model Context Protocol (MCP)
Model Context Protocol (MCP) ist ein offener Standard, der es KI-Anwendungen erlaubt, sich über eine gemeinsame Schnittstelle mit externen Tools, Datenquellen und Diensten zu verbinden. Statt für jedes Modell und jedes Tool eine eigene Integration zu schreiben, bauen Entwickler einmal einen MCP-Server, und jeder MCP-kompatible Client, etwa ein KI-Assistent oder Coding-Agent, kann ihn nutzen.
Modell-Distillation
Modell-Distillation ist die Technik, ein kleineres Student-Modell zu trainieren, das Verhalten eines größeren Teacher-Modells zu reproduzieren, wobei die Outputs des Teachers als Trainingssignal genutzt werden. Der Student behält den größten Teil der Fähigkeit des Teachers bei den anvisierten Aufgaben, während er schneller und günstiger läuft, was ihn zu einem Standardwerkzeug macht, um Inferenzkosten zu senken. Das kanonische frühe Ergebnis ist DistilBERT, das Hugging Face 2019 als 40 % kleiner und 60 % schneller als BERT berichtete, bei Erhalt von 97 % seines Sprachverständnisses.
Modell-Drift
Modell-Drift ist die Verschlechterung der Real-World-Performance eines KI-Systems über die Zeit, während sein Code unverändert bleibt. Sie passiert, wenn sich die Welt von dem entfernt, was das Modell gelernt hat (Data Drift und Concept Drift), oder, bei LLM-basierten Systemen, wenn ein Anbieter das zugrundeliegende Modell aktualisiert und sich Verhalten unter Ihren Prompts ändert.
Multi-Agenten-System
Ein Multi-Agenten-System ist eine Architektur, in der mehrere KI-Agenten mit unterschiedlichen Rollen an einem Problem zusammenarbeiten, das zu groß oder zu vielfältig ist, als dass ein einzelner Agent es gut bewältigen könnte. Jeder Agent läuft in seinem eigenen Kontext mit eigenen Anweisungen und Tools, und eine Koordinationsschicht bewegt Aufgaben und Ergebnisse zwischen ihnen.
Multimodale KI
Multimodale KI bezeichnet Modelle, die mehr als eine Art von Input akzeptieren und darüber reasonen, etwa Text, Bilder, Audio und Video, innerhalb eines einzigen Systems. Für Software-Teams ist das die Fähigkeit, die einen Agenten einen Screenshot lesen, ein Diagramm interpretieren oder eine Bildschirmaufnahme ansehen lässt, statt nur mit Text zu arbeiten. Die Fähigkeit kam mit Wucht: GPT-4, ein großes multimodales Modell, das Bild- und Text-Inputs akzeptiert, erzielte 2023 einen Score um die obersten 10 % der Prüflinge in einem simulierten Anwaltsexamen.
N
O
Orchestrator-Agent
Ein Orchestrator-Agent ist der Lead-Agent in einem Multi-Agenten-System. Er erhält das Gesamtziel, zerlegt es in Teilaufgaben, delegiert jede an Worker-Agenten mit dem Kontext, den sie brauchen, bewertet, was zurückkommt, und setzt die Teile zu einem finalen Ergebnis zusammen. Er trifft Koordinationsentscheidungen, statt die fachliche Arbeit selbst zu erledigen.
P
Prompt Caching
Prompt Caching ist eine Inferenz-Optimierung, die den berechneten internen Zustand eines wiederholten Prompt-Präfixes speichert, sodass spätere API-Aufrufe, die dieses Präfix wiederverwenden, die erneute Verarbeitung überspringen. Für Agenten, die bei jeder Runde einen großen Systemprompt, Tool-Definitionen und wachsenden Konversationsverlauf erneut senden, senkt das die Input-Kosten drastisch und reduziert die Zeit bis zum ersten Token.
Prompt Chaining
Prompt Chaining ist die Technik, eine komplexe Aufgabe in eine Sequenz separater Modellaufrufe zu zerlegen, bei der jeder Prompt den Output des vorherigen konsumiert. Statt in einem einzigen Prompt um alles zu bitten, erledigt jeder Schritt eine fokussierte Aufgabe, wobei zusätzliche Latenz und Kosten gegen höhere Zuverlässigkeit und leichteres Debugging getauscht werden.
Prompt Engineering
Prompt Engineering ist die Praxis, den an ein KI-Modell gesendeten Text zu gestalten, einschließlich Anweisungen, Beispielen, Einschränkungen und Output-Format, sodass das Modell zuverlässig das gewünschte Ergebnis produziert. Es behandelt den Prompt als engineertes Artefakt, etwas bewusst Geschriebenes, gegen Fälle Getestetes und in der Versionskontrolle Verwaltetes, statt einer beiläufig in eine Chat-Box getippten Frage. Das Feld ist größer, als es von außen aussieht: The Prompt Report, eine Umfrage von Schulhoff et al. aus 2024, katalogisiert 58 unterschiedliche textbasierte Prompting-Techniken plus 40 weitere für andere Modalitäten.
Prompt Injection
Prompt Injection ist ein Angriff, bei dem bösartige Anweisungen in Inhalten versteckt werden, die ein KI-System verarbeitet, etwa eine Webseite, eine E-Mail oder ein Dokument, sodass das Modell den Befehlen des Angreifers folgt statt denen der Nutzenden. Er nutzt aus, dass Sprachmodelle vertrauenswürdige Anweisungen nicht zuverlässig von nicht vertrauenswürdigen Daten trennen können. Die OWASP Top 10 für LLM-Anwendungen 2025 führt Prompt Injection als LLM01, das Top-Risiko der Liste.
Q
R
ReAct-Agent
Ein ReAct-Agent ist ein KI-Agent, der auf dem Reasoning-and-Acting-Muster aufbaut: Das Modell formuliert einen Gedanken darüber, was als Nächstes zu tun ist, führt eine Aktion aus – etwa einen Tool-Aufruf –, beobachtet das Ergebnis und wiederholt diesen Zyklus, bis die Aufgabe erledigt ist. Die Verzahnung von explizitem Reasoning mit Aktionen verankert jede Entscheidung in realen Beobachtungen.
Reasoning-Modell
Ein Reasoning-Modell ist ein Large Language Model, das darauf trainiert ist, ein Problem Schritt für Schritt zu durchdenken, bevor es sich auf eine Antwort festlegt, und dafür zusätzliche Inferenz-Rechenleistung für interne Abwägung aufwendet. Diese Denkphase, oft verborgen oder zusammengefasst, verbessert die Genauigkeit bei Mathematik-, Code- und mehrstufigen Planungsaufgaben – auf Kosten höherer Latenz und höheren Tokenverbrauchs. Die Verbesserungen sind messbar: DeepSeek-R1 erreichte beim AIME-2024-Mathematikwettbewerb 79,8 % Pass@1 und lag damit leicht vor OpenAIs o1-1217.
Retrieval-Augmented Generation (RAG)
Retrieval-Augmented Generation (RAG) ist eine Architektur, die zur Anfragezeit eine Wissensquelle nach für die Anfrage relevanten Dokumenten durchsucht und diese in den Prompt des Modells einfügt, sodass die Antwort auf abgerufenen Belegen beruht statt nur auf dem, was das Modell während des Trainings memoriert hat. Sie verschafft Modellen Zugriff auf private, aktuelle und überprüfbare Informationen. Der Name geht auf ein NeurIPS-Paper von Lewis et al. bei Meta AI aus dem Jahr 2020 zurück, das bei drei Open-Domain-Frage-Antwort-Aufgaben den Stand der Technik setzte und Sprache erzeugte, die die Autoren als spezifischer, vielfältiger und faktentreuer maßen als eine rein parametrische Baseline.
RLHF
RLHF, Reinforcement Learning from Human Feedback, ist eine Trainingsmethode, die ein Sprachmodell an menschlichen Präferenzen ausrichtet. Menschen bewerten oder ranken Paare von Modellausgaben, ein Reward-Modell lernt, diese Urteile vorherzusagen, und das Sprachmodell wird anschließend gegen diese Belohnung optimiert. Es ist der Schritt, der aus reinen Textvorhersagemaschinen brauchbare Assistenten gemacht hat.
S
Schatten-KI
Schatten-KI ist der Einsatz von KI-Tools innerhalb einer Organisation ohne Genehmigung, Aufsicht oder Sicherheitsprüfung: Mitarbeitende fügen Unternehmensdaten in Consumer-Chatbots ein, verdrahten ungeprüfte KI-Funktionen in Arbeitsabläufe oder nutzen private Agenten-Abonnements für Arbeitsaufgaben. Sie ist der Nachfolger der Schatten-IT im KI-Zeitalter, wobei Datenabfluss das zentrale Risiko darstellt.
Semantische Suche
Semantische Suche ist eine Retrieval-Methode, die Anfragen anhand ihrer Bedeutung statt anhand gemeinsamer Schlüsselwörter mit Dokumenten abgleicht, typischerweise indem beide in Vektor-Embeddings umgewandelt und Dokumente danach eingestuft werden, wie nah ihre Vektoren an dem der Anfrage liegen. Eine Suche nach "Passwort zurücksetzen" kann ein Dokument mit dem Titel "Wiederherstellung von Kontoanmeldedaten" zutage fördern, obwohl beide kein einziges Wort teilen. Der Ansatz erreichte 2019 breite Anwendung, als Google BERT in der Suche einsetzte, um die Bedeutung von Anfragen zu interpretieren, und erklärte, das Modell werde das Verständnis von einer von zehn englischsprachigen Suchanfragen in den USA verbessern.
Skill-Atrophie
Skill-Atrophie ist der schleichende Verfall der Fähigkeit eines Entwicklers, Code ohne fremde Hilfe zu schreiben, zu lesen und zu debuggen – verursacht durch die Delegation dieser Arbeit an KI-Tools. Der Verlust bleibt im Alltag unsichtbar, weil die Ausgaben des Agenten weiterhin termingerecht ausgeliefert werden, und tritt erst zutage, wenn die KI versagt, an ihre Grenzen stößt oder etwas Falsches produziert, das ein Mensch allein entwirren muss.
Slopsquatting
Slopsquatting ist ein Supply-Chain-Angriff, bei dem jemand Pakete unter Namen registriert, die KI-Coding-Tools halluzinieren, sodass Entwickelnde, die eine erfundene Abhängigkeit eines Modells installieren, den Code des Angreifers statt eines Fehlers ziehen. Er funktioniert, weil Modelle wiederholt dieselben plausiblen Paketnamen halluzinieren, was diese Namen vorhersagbar und squatting-wert macht.
Small Language Model
Ein Small Language Model (SLM) ist ein kompaktes Sprachmodell, typischerweise unter etwa zehn Milliarden Parametern, designt, um schnell und günstig zu laufen, oft auf einer einzelnen GPU, einem Laptop oder einem Telefon. Es tauscht die Spitzenfähigkeit von Frontier-Modellen gegen niedrige Latenz, niedrige Kosten, Datenschutz, und die Option, On-Device zu deployen.
Spezifikationsgetriebene Entwicklung
Spezifikationsgetriebene Entwicklung ist die Praxis, eine präzise Spezifikation mit Anforderungen und Abnahmekriterien zu schreiben, bevor ein KI-Agent mit dem Bauen beginnt. Die Spezifikation wird zur dauerhaften Quelle der Wahrheit, gegen die der Agent implementiert und Reviewer verifizieren, und ersetzt die verstreute Prompt-Historie, die Ad-hoc-KI-Coding hinterlässt.
Structured Outputs
Structured Outputs ist eine Technik, die die Antwort eines Sprachmodells zwingt, einem vom Entwickler bereitgestellten Schema zu entsprechen, typischerweise JSON Schema, sodass nachgelagerter Code sie ohne defensives Raten parsen kann. Statt zu hoffen, dass das Modell seine Antwort korrekt formatiert, schränkt die API die Generierung so ein, dass nur schema-valider Output möglich ist.
Subagent
Ein Subagent ist ein Kind-Agent, den ein Lead-Agent erzeugt, um eine abgegrenzte Aufgabe in einem separaten Context Window zu bearbeiten. Er erhält ein Briefing, arbeitet unabhängig mit eigenen Tools und Anweisungen, und liefert nur sein Ergebnis zurück. Der Parent hält seinen eigenen Kontext sauber, während der Subagent das explorative Rauschen absorbiert. Anthropics Forschungssystem baut auf dieser Idee auf und erzeugt 3 bis 5 Subagenten parallel, jeder in seinem eigenen Context Window, um eine komplexe Anfrage zu bearbeiten.
Synthetische Daten
Synthetische Daten sind künstlich generierte Daten, meist von einem Modell produziert statt von echten Nutzenden oder Ereignissen gesammelt, genutzt, um KI-Systeme zu trainieren, feinzutunen, oder zu testen. Teams greifen darauf zurück, wenn echte Daten knapp, privat, teuer zu labeln sind, oder die Randfälle fehlen, aus denen ein Modell lernen muss.
System Prompt
Ein System Prompt ist das stehende Set von Anweisungen, das einem Sprachmodell vor jedem Nutzer-Input gegeben wird und seine Rolle, Regeln, Ton, und Einschränkungen für die gesamte Sitzung definiert. Anders als eine Nutzernachricht bleibt er über jede Runde bestehen und hat Priorität, wenn Anweisungen kollidieren, was ihn zur primären Kontrollfläche für Modellverhalten macht.
T
Tokenisierung
Tokenisierung ist der Prozess, Text in Tokens zu zerlegen, die kleinen Einheiten, die ein Sprachmodell tatsächlich liest, unter Nutzung eines festen, aus Trainingsdaten gelernten Vokabulars. Häufige Wörter werden zu einzelnen Tokens, während seltene Wörter in Fragmente zerbrechen, und jede Modell-API misst Kosten und Kontextlimits in den Tokens, die dieser Prozess produziert. Als Referenzpunkt bildet Anthropics Tokenizer etwa 3,5 englische Zeichen auf ein Token ab, wobei das Verhältnis über Sprachen hinweg variiert.
Tool Calling
Tool Calling ist die Fähigkeit eines Sprachmodells, externe Funktionen aufzurufen, etwa einen Befehl auszuführen, eine API abzufragen, oder eine Datei zu lesen, statt nur Text zu generieren. Das Modell gibt eine strukturierte Anfrage aus, die ein Tool und seine Argumente benennt, die Host-Anwendung führt sie aus, und das Ergebnis fließt zurück in den nächsten Schritt des Modells.
Transformer Model
Ein Transformer Model ist die neuronale Netzwerkarchitektur hinter modernen Large Language Models. Sein bestimmendes Merkmal ist Attention: Layer, die jedes Token in einer Sequenz jedes andere Token direkt gewichten lassen, wenn berechnet wird, was als Nächstes kommt. Eingeführt von Google-Forschenden 2017, ersetzte es sequenzielle Architekturen, weil es effizient parallel auf GPUs trainiert. Das Originalmodell kündigte sich mit Ergebnissen an: 28,4 BLEU bei WMT 2014 Englisch-Deutsch-Übersetzung, das den vorherigen Besten, Ensembles eingeschlossen, um mehr als 2 BLEU schlug.
U
V
Vektor-Embedding
Ein Vektor-Embedding ist eine Liste von Zahlen, die die Bedeutung eines Stücks Text, Code, oder eines Bildes repräsentiert, produziert von einem Machine-Learning-Modell. Inhalt mit ähnlicher Bedeutung bekommt Zahlen, die nahe beieinander in diesem numerischen Raum sitzen, was Software erlaubt, verwandte Elemente zu finden, indem sie Distanz misst statt Schlüsselwörter abzugleichen.
Vektordatenbank
Eine Vektordatenbank ist ein Datenspeicher, gebaut, um Embeddings zu halten, die numerischen Vektoren, die die Bedeutung von Text, Bildern, oder Code repräsentieren, und um Ähnlichkeitsabfragen darüber schnell zu beantworten. Gegeben einen Query-Vektor, gibt sie die gespeicherten Elemente zurück, die in der Bedeutung am nächsten sind, was sie zum Retrieval-Rückgrat von RAG-Systemen, semantischer Suche, und Agent Memory macht.
Verständnisschuld
Verständnisschuld ist die angehäufte Menge an Code in einem Produktionssystem, den niemand im Team wirklich versteht, entstanden dadurch, dass KI-generierte Änderungen ohne echtes Review ausgeliefert werden. Der Code funktioniert und die Tests bestehen, aber das Wissen, das sich normalerweise beim Schreiben des Codes in einem menschlichen Kopf bildet, ist nirgendwo entstanden, und die Lücke wächst mit jedem ungeprüften Merge.
Vibe Coding
Vibe Coding ist das Bauen von Software, indem man in natürlicher Sprache beschreibt, was man will, und den KI-generierten Code akzeptiert, ohne ihn zu reviewen oder vollständig zu verstehen. Man beurteilt das Ergebnis danach, ob es zu funktionieren scheint, und tauscht Sorgfalt und Verständnis gegen Geschwindigkeit. Der Begriff kommt von einer Beobachtung Andrej Karpathys aus 2025, dass Entwickelnde jetzt "vergessen können, dass der Code überhaupt existiert."
W
X
Y
Z
Zero-Shot-Learning
Der Prompt-Inhalt. Zero-Shot liefert nur Anweisungen; Few-Shot fügt eine Handvoll ausgearbeiteter Input-Output-Demonstrationen hinzu, die das Modell imitieren soll. Zero-Shot ist günstiger pro Aufruf und leichter zu pflegen, da keine Beispiele kuratiert und konsistent gehalten werden müssen. Few-Shot gewinnt, wenn Formatpräzision, ungewöhnliche Konventionen, oder Randfall-Behandlung zählen, weil Demonstrationen das genauer vermitteln als Prosa. Keines aktualisiert das Modell; beide sind Inferenzzeit-Techniken, und der praktische Workflow ist, Zero-Shot zu beginnen, zu messen, und Beispiele nur dort hinzuzufügen, wo die Messungen es sagen.
Lass uns sprechen
Bereit, dein Produkt zu entwickeln?
Buche ein Beratungsgespräch für eine kostenlose Projektbewertung
und eine Einschätzung des Umfangs deines Projekts.

