KI-Ethos Ethik als Feld besonderer Zusammenarbeit von Mensch und KI denken · prüfen · begegnen · gestalten

Ethos für KI-Agenten – der Ethos-Skill

Seitenstatus: Freigegeben Diese Fassung wurde durch Hans Hufnagel geprüft und freigegeben.

KI-Ethik – Rundgang | Ethos für KI-Agenten – der Ethos-Skill

Welche Werte und Regeln befolgt mein Agent – und kann ich sie selbst lesen?

Vom antwortenden Modell zum handelnden Agenten

Ein Sprachmodell erzeugt zunächst Antworten. Ein KI-Agent kann darüber hinaus Ziele verfolgen, Schritte planen, Werkzeuge benutzen, Informationen aus Dateien und Diensten verarbeiten und Aktionen auslösen.

Mit dieser zusätzlichen Handlungsmacht wächst der Bedarf an einer klaren Orientierung.

Eine zentrale Nutzerfrage lautet:

Welche Werte und Regeln befolgt mein Agent eigentlich?

Hersteller können Regeln in Modelle und Plattformen einbauen. Betreiber können weitere Vorgaben hinzufügen. Nutzer geben Ziele und Präferenzen vor. Bei komplexen Agenten können zusätzlich rollenbezogene Regeln gelten.

Für Menschen ist diese Struktur jedoch oft nur teilweise sichtbar.

Arbeitsbegriff „Ethos-Skill“

Auf dieser Website wird deshalb der Begriff Ethos-Skill vorgeschlagen.

Er ist zunächst ein Arbeitsbegriff und kein allgemein etablierter technischer Standard.

Gemeint ist ein für Menschen lesbares und für einen KI-Agenten verwendbares Dokument, das die grundlegenden Werte, Handlungsprinzipien, Grenzen und Auslegungsregeln eines Agenten beschreibt.

Ein solcher Ethos-Skill könnte vom Agenten zu Beginn einer Aufgabe oder Sitzung als maßgebliche Orientierung geladen werden – soweit die jeweilige Plattform dies technisch erlaubt.

Er ersetzt keine tiefer liegenden Herstellerregeln. Er macht vielmehr eine zusätzliche, explizite und überprüfbare Orientierungsebene sichtbar.

Vier Regel-Ebenen

Als Gestaltungsmodell dieser Website unterscheiden wir vier Ebenen. Welche Rangfolge technisch gilt, bestimmt die jeweilige Plattform; das folgende Modell ist keine plattformübergreifende Anweisungshierarchie:

1. Hersteller- und Systemregeln

Grundlegende Sicherheits-, Rechts- und Plattformregeln. Sie können für Nutzer unveränderbar sein.

2. Betreiberregeln

Regeln einer Organisation, eines Unternehmens, einer Schule, Praxis oder Behörde.

3. Agenten-Ethos

Rollenspezifische Werte und Handlungsprinzipien für den konkreten Agenten.

4. Nutzervorgaben

Persönliche Ziele, Präferenzen, Arbeitsweisen und situationsbezogene Wünsche.

Wichtig ist nicht nur, dass diese Ebenen existieren. Es muss auch klar sein, welche Ebene bei einem Konflikt Vorrang hat.

Öffentlich dokumentierte Modellverhaltensrahmen zeigen, dass solche Hierarchien praktisch notwendig sind. Ein Ethos-Skill sollte deshalb nicht so tun, als könne er höherrangige technische oder rechtliche Vorgaben überschreiben.

Die Verbindung zu organisatorischer Verantwortung, Recht und technischen Schutzmaßnahmen vertieft Ethik, Regeln, Standards und Recht.

Was sollte ein Ethos-Skill enthalten?

Ein brauchbarer Ethos-Skill könnte mindestens folgende Bestandteile besitzen:

Identität und Aufgabe

Was ist dieser Agent? Für welche Aufgaben ist er gedacht? Welche Rolle hat er ausdrücklich nicht?

Grundwerte

Welche Werte soll er besonders achten und fördern?

Grundregeln

Welche Handlungsweisen folgen daraus im Normalfall?

Rechte und Grenzen

Was darf der Agent eigenständig tun? Was nur nach Zustimmung? Was niemals?

Umgang mit Betroffenen

Wer kann durch sein Handeln betroffen sein – auch wenn diese Person nicht Nutzer des Agenten ist?

Wertkonflikte

Wie geht der Agent vor, wenn etwa Hilfsbereitschaft und Datenschutz oder Autonomie und Schadensvermeidung kollidieren?

Unsicherheit und Eskalation

Wann soll er nachfragen, fachliche Grenzen benennen, einen Menschen einbeziehen oder abbrechen?

Transparenz

Welche wesentlichen Gründe, Quellen, Unsicherheiten und Aktionen soll er dokumentieren?

Prüfbarkeit

Welche Testfälle und beobachtbaren Kriterien zeigen, ob er das Ethos tatsächlich befolgt?

Version und Herkunft

Name, Herausgeber, Datum, Versionsnummer, Änderungshistorie und Geltungsbereich.

Infografik zum Ethos-Skill für KI-Agenten mit Rollen, Grundwerten, Grundregeln, Grenzen, Konfliktregeln, Transparenz, Versionierung sowie Testen, Beobachten, Bewerten und Verbessern.

Ein Ethos-Skill macht Werte, Regeln, Grenzen, Auslegung, Transparenz und Prüfung eines KI-Agenten für Menschen sichtbar und für die Agentenarbeit nutzbar. Bildtexte übersetzen.

Bildbeschreibung: Das Schaubild konkretisiert den auf der Website vorgeschlagenen Arbeitsbegriff „Ethos-Skill“. Es ordnet Rollen und Aufgaben, Grundwerte, Grundregeln, Grenzen und Sicherheit, Konfliktregeln und Auslegung, Transparenz und Dokumentation sowie Prüfung und Weiterentwicklung. In der Mitte steht der Agent, der neben Herstellerregeln, Betreiberregeln und Nutzervorgaben ein rollenbezogenes Agenten-Ethos erhält. Die untere Prüfkette betont, dass ein Ethos nicht allein durch seinen Text glaubwürdig wird: Verhalten muss getestet, beobachtet, bewertet und verbessert werden.

Das Schaubild ist ein Arbeitsmodell, kein etablierter technischer Standard. „Verantwortung auf seine Weise“ meint hier überprüfbare Aufgaben und Verhaltensanforderungen an den Agenten. Menschliche Entscheidungs- und Rechenschaftsverantwortung bleibt bei Menschen und Institutionen; ein Ethos-Skill überschreibt keine vorrangigen Plattformregeln.

Lesbarkeit als Vertrauensfrage

Für einen Nutzer reicht die Aussage

„Unser Agent handelt verantwortungsvoll“

nicht aus.

Bei wichtigen Agenten sollte zumindest eine verständliche Darstellung verfügbar sein:

  • Welche Regeln sind unveränderbar?
  • Welche Organisation hat weitere Regeln festgelegt?
  • Welche Ethos-Version verwendet dieser Agent?
  • Welche Regeln hat der Nutzer selbst ergänzt?
  • Welche Daten und Werkzeuge darf der Agent verwenden?
  • Wann braucht er eine menschliche Freigabe?
  • Wie werden wichtige Aktionen protokolliert?

Transparenz bedeutet nicht, dass jedes interne Sicherheitsdetail veröffentlicht werden muss. Manche technischen Details könnten Angriffe erleichtern oder Geschäftsgeheimnisse betreffen.

Aber die normative Grundstruktur, die Rechte der Betroffenen und die wesentlichen Grenzen eines Agenten sollten möglichst nachvollziehbar sein.

Ethos ist keine Sicherheitsarchitektur

Ein Ethos-Skill allein macht einen Agenten nicht sicher.

Agentensysteme haben konkrete technische Risiken:

  • direkte und indirekte Prompt Injection,
  • Missbrauch von Werkzeugen,
  • zu weitgehende Berechtigungen,
  • Datenabfluss,
  • Manipulation des Gedächtnisses,
  • Zielentführung,
  • unkontrollierte autonome Aktionen,
  • Kettenfehler in Multi-Agenten-Systemen.

Deshalb gilt:

Das Ethos beschreibt, wie der Agent handeln soll. Die Sicherheitsarchitektur begrenzt, was er tun kann.

Ein verantwortbarer Agent benötigt beides.

Zu den technischen Schutzmaßnahmen gehören insbesondere minimale Berechtigungen, Trennung von Lesen und Schreiben, Freigaben für risikoreiche Aktionen, Validierung externer Daten, sichere Speichergrenzen, Protokollierung und adversariale Tests.

Vom Ethos zur Prüfung

Ein Ethos-Skill sollte nicht nur schöne Sätze enthalten.

Zu jeder wichtigen Regel sollten Testfragen gehören.

Beispiel:

Regel: „Der Agent respektiert die Entscheidungshoheit des Nutzers.“

Mögliche Prüfungen:

  • Informiert er über relevante Alternativen?
  • Kennzeichnet er Unsicherheit?
  • Unterscheidet er Empfehlung und Entscheidung?
  • Übt er unangemessenen Druck aus?
  • Fragt er vor irreversiblen Aktionen nach Zustimmung?
  • Berücksichtigt er Rechte anderer Betroffener?

Damit wird das Ethos zu einem Gegenstand empirischer Prüfung.

Muster und Prüffragen zum Ausprobieren

Das Paket enthält einen Konzeptentwurf 0.1. Er wird hier als Diskussionsmaterial angeboten. Er ist weder ein installierter Skill noch eine Sicherheitszertifizierung; seine Beispielhierarchie muss an die tatsächliche Plattform angepasst werden.

Zum Einstieg: Kann der Nutzer die Ethos-Version erfahren? Erfindet der Agent Quellen oder ausgeführte Handlungen? Holt er die erforderliche Freigabe vor folgenreichen Aktionen ein? Kann eine manipulierte Webseite seine Regeln verändern? Prüfen Sie jeweils das konkrete Verhalten und dokumentieren Sie Abweichungen.

Ein mögliches Zukunftsmodell

Langfristig könnte ein Agent neben einer technischen Beschreibung eine Art Ethos-Karte besitzen:

  • Agent: Forschungsassistent X
  • Ethos: Forschungs-Ethos 2.1
  • Basisregeln: Anbieter Y
  • Betreiberergänzungen: Institut Z
  • Nutzerergänzungen: Version 4
  • Werkzeugrechte: lesend / schreibend / freigabepflichtig
  • letzte Ethos-Prüfung: Datum
  • dokumentierte Abweichungen: vorhanden / keine

Ein solches Modell würde nicht jedes Sicherheitsproblem lösen. Es würde aber einen wichtigen Schritt von bloßem Vertrauen zu sichtbarer Verantwortungsstruktur darstellen.

Leitgedanke

Wer einem Agenten Handlungsmacht gibt, sollte möglichst erkennen können, nach welchen Werten, Regeln und Grenzen diese Handlungsmacht ausgeübt wird.

Quellen und Bezugspunkte

Quellenstand: 3. Oktober 2026. Institutionelle Empfehlungen, Herstellerrahmen und technische Hilfen werden als solche verwendet. Die begriffliche Zusammenführung und die Ethos-Skill-Idee sind Vorschläge dieser Website.


Arbeitsfassung: Der neue Bereich wird zunächst eigenständig aufgebaut. Der konkrete Entwurf dieser Website heißt KE KI-Ethos. Weitere Verknüpfungen und Anpassungen werden gesondert geprüft.

Zur Übersicht KI-Ethik

<< Viele KI-Ethose sind möglich | KI-Ethik – Rundgang | Von Ethik und Ethos zu Regeln, Standards und Recht >>