Modelle & Technologien

Agenten, Modelle und Sprach-KI im Überblick

Ein tieferer Einblick, wie KI-Systeme heute aufgebaut sind: von einfachen Chatbots über Agenten und Subagenten bis zu den Sprachmodellen dahinter und der Fähigkeit, Sprache direkt zu verstehen.

Arten von KI-Systemen

Nicht jede KI-Anwendung funktioniert gleich. Die folgende Einordnung hilft, Angebote und Anbieter besser einzuschätzen.

ChatbotEinfachste Stufe

Beantwortet Fragen in einem Dialogfenster, meist auf Basis eines vorgegebenen Themenbereichs. Kann in der Regel keine eigenständigen Aktionen außerhalb des Gesprächs ausführen.

KI-AssistentErweitert

Ein Chatbot mit Zugriff auf zusätzliche Informationen oder einfache Funktionen, etwa Kalender, E-Mail-Postfach oder eine Wissensdatenbank des Unternehmens.

KI-AgentHandlungsfähig

Plant und führt mehrstufige Aufgaben eigenständig aus: recherchieren, ein Werkzeug aufrufen, das Ergebnis bewerten und den nächsten Schritt selbst festlegen – statt nur eine einzelne Antwort zu geben.

SubagentSpezialisiert

Ein Agent, der von einem übergeordneten Agenten für eine klar abgegrenzte Teilaufgabe eingesetzt wird, etwa reine Recherche, reine Datenauswertung oder das Verfassen eines Textabschnitts.

Multi-Agenten-SystemZusammenspiel

Mehrere Agenten und Subagenten, die sich eine komplexe Aufgabe aufteilen und ihre Teilergebnisse an einen koordinierenden Agenten zurückgeben, der sie zusammenführt.


Sprachmodelle im Überblick

Hinter Chatbots, Assistenten und Agenten steht meist ein Large Language Model (LLM). Die bekanntesten Modellfamilien im Überblick – ohne Wertung, als reine Orientierung.

GPT-ReiheOpenAI

Modellfamilie hinter ChatGPT. Proprietär, über eine API nutzbar, breit verbreitet in Chat- und Agenten-Anwendungen.

ClaudeAnthropic

Proprietäre Modellfamilie mit Fokus auf lange Kontextfenster und Werkzeugnutzung, ebenfalls über eine API einbindbar.

GeminiGoogle

Von Google entwickelte, multimodale Modellfamilie – von Beginn an für Text-, Bild- und Audioeingaben ausgelegt.

LlamaMeta, offen

Offen verfügbare Modellgewichte, die auch auf eigener Hardware oder in einer eigenen Cloud-Umgebung betrieben werden können – relevant für Unternehmen mit strengen Datenschutzanforderungen.

MistralEuropa, offen

Europäischer Anbieter mit teils offen verfügbaren Modellen; oft eine Option, wenn Datenverarbeitung innerhalb der EU gewünscht ist.


Audioeingaben & Sprach-KI

KI beschränkt sich längst nicht mehr auf Text. Für Unternehmen sind vor allem folgende Bausteine relevant.

Speech-to-TextTranskription

Wandelt gesprochene Sprache in Text um – etwa für Meeting-Protokolle, Diktierfunktionen oder die Verschriftlichung von Kundengesprächen.

Text-to-SpeechSprachausgabe

Erzeugt aus Text natürlich klingende Sprache, etwa für Sprachassistenten, Telefonansagen oder vorgelesene Inhalte.

Native AudioeingabeDirektverarbeitung

Neuere multimodale Modelle nehmen Audio direkt als Eingabe entgegen, ohne den Umweg über eine separate Transkription – das reduziert Verzögerung und erhält Tonfall und Betonung.

Echtzeit-SprachassistentenLive-Dialog

Ermöglichen ein gesprochenes Hin und Her nahezu ohne Verzögerung – Grundlage für KI-gestützte Telefonassistenz oder Voicebots im Kundenservice.


Multimodalität

Viele aktuelle Modelle verarbeiten mehr als nur Text in einer einzigen Anfrage.

BildeingabeVision

Modelle können Fotos, Screenshots oder Diagramme lesen und beschreiben – etwa zur Auswertung von Belegen oder zur Qualitätsprüfung.

DokumenteneingabePDF & Co.

Ganze Dokumente lassen sich einlesen und zusammenfassen, durchsuchen oder mit gezielten Fragen auswerten.

Kombinierte EingabenText + Bild + Audio

Ein einziges Modell kann Text, Bild und Audio in derselben Anfrage gemeinsam berücksichtigen – etwa ein Foto plus eine gesprochene Frage dazu.