Mo - Fr 09:00 - 18:00 Uhr | 0221 / 177 347 40 | hello@kibrains.de
DSGVO-konform 700+ Projekte
Werktags Mo - Fr 09:00 - 18:00 Uhr Tel.: 0221 / 177 347 40 Mail: hello@kibrains.de

Wirkung von KI-Projekten messen: vier Kennzahlen, die vor dem Start feststehen

AutorGeschäftsführer
Fachlich geprüft vonWaldemar DenkeLead Entwickler
VeröffentlichtStand der Angaben: 26. September 2026

Inhalt

  1. Wo der Nutzen heute verloren geht
  2. Der Ausgangswert kommt vor dem ersten Eingriff
  3. Vier Kennzahlen, die fast immer tragen
  4. Ein Rechenbeispiel aus dem Rechnungseingang
  5. Qualität messen, wo es kein eindeutiges Richtig gibt
  6. Messen im laufenden Betrieb
  7. Was eine gute Messung ausmacht

Viele Unternehmen setzen KI inzwischen ein, und genau jetzt kommt die nächste Frage auf den Tisch: Was bringt es? Wer diese Frage mit einer Zahl aus dem eigenen Betrieb beantworten kann, entscheidet über den Ausbau in Minuten. Wer sie mit einem Eindruck beantwortet, diskutiert wochenlang.

Der Unterschied entsteht selten am Ende eines Projekts, sondern ganz am Anfang. In diesem Beitrag zeige ich, welche Kennzahlen wir vor dem Start festlegen, wie der Ausgangswert entsteht und wie sich die Wirkung auch dort belegen lässt, wo es kein eindeutiges Richtig oder Falsch gibt.

Wo der Nutzen heute verloren geht

Laut Bitkom nutzen 41 Prozent der Unternehmen ab 20 Beschäftigten in Deutschland KI. 52 Prozent berichten von einem messbaren Beitrag der KI zum Unternehmenserfolg, und ein Drittel hat festgestellt, dass KI zu deutlich höheren Kosten geführt hat. Befragt wurden 604 Unternehmen im Januar und Februar 2026.

International sieht es ähnlich aus. In der Studie The state of AI von McKinsey gaben weniger als eines von fünf Unternehmen an, Kennzahlen für seine Lösungen mit generativer KI zu verfolgen. Das war die am seltensten umgesetzte von zwölf untersuchten Praktiken. Gleichzeitig war sie diejenige mit dem stärksten Zusammenhang zum Ergebnis vor Zinsen und Steuern. Über 80 Prozent der Befragten sahen durch generative KI noch keinen spürbaren Effekt auf das Gesamtergebnis ihres Unternehmens. Befragt wurden 1.491 Personen im Juli 2024.

„Führungskräfte warten ungeduldig auf Erträge aus ihren Investitionen in generative KI, doch Organisationen tun sich schwer, den Wert zu belegen und zu realisieren.“
Rita Sallam, Distinguished VP Analyst bei Gartner, übersetzt · Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept

Gartner hatte schon im Juli 2024 erwartet, dass mindestens 30 Prozent der Projekte mit generativer KI nach dem Proof of Concept aufgegeben werden. Als Gründe nannte Gartner schlechte Datenqualität, unzureichende Risikokontrollen, steigende Kosten und einen unklaren geschäftlichen Nutzen. Die ersten drei lassen sich technisch lösen. Der vierte ist eine Frage der Planung, und genau hier setzt eine saubere Messung an.

Der Ausgangswert kommt vor dem ersten Eingriff

Eine Verbesserung ist immer ein Vergleich. Deshalb steht bei uns vor jedem Pilot eine kurze Bestandsaufnahme des Ablaufs, so wie er heute läuft: wie viele Vorgänge im Monat anfallen, wie lange sie dauern, wie viele Minuten jemand daran arbeitet und wie oft nachgebessert wird.

Der Aufwand dafür ist überschaubar: In den meisten Häusern genügt eine Woche. Die Zeitstempel liefern die Systeme ohnehin, die Bearbeitungszeit schreiben die Beteiligten für fünf Arbeitstage selbst auf, und für die Qualität reicht eine Stichprobe aus dem Vormonat. Das Ergebnis ist ein Blatt mit vier Zahlen, und dieses Blatt ist der wertvollste Anhang jedes Angebots.

Wichtig ist, den Ausgangswert gemeinsam mit den Menschen zu erheben, die den Vorgang heute erledigen. Sie kennen die Sonderfälle, die in keiner Prozessbeschreibung stehen, und sie sind später diejenigen, die den neuen Ablauf tragen. Genau so beginnt bei uns die erste Woche einer KI Beratung.

Vier Kennzahlen, die fast immer tragen

Welche Kennzahl die wichtigste ist, hängt vom Ablauf ab. Diese vier lassen sich aber in nahezu jedem Vorgang erheben, vom Rechnungseingang bis zur Angebotserstellung:

Vier Kennzahlen, die sich in fast jedem Ablauf erheben lassen.
KennzahlWas sie misstWoher der Wert kommt
DurchlaufzeitDie Zeit vom Eingang eines Vorgangs bis zu seinem Abschluss.Zeitstempel im System: Eingang, Buchung, Versand.
BearbeitungszeitDie Minuten, die ein Mensch je Vorgang tatsächlich einsetzt.Eine Woche Selbstaufschreibung oder eine Stichprobe mit Stoppuhr.
AutomatisierungsquoteDer Anteil der Vorgänge, die ohne Handgriff durchlaufen.Protokoll des Systems, je Vorgang ein Vermerk.
ErstlösungsquoteDer Anteil der Vorgänge, die beim ersten Mal vollständig richtig erledigt sind.Korrekturen, Rückfragen und Stornos im Folgemonat.

Zwei Hinweise aus der Praxis. Erstens: Die Durchlaufzeit überzeugt die Geschäftsleitung, die Bearbeitungszeit überzeugt den Controller. Es lohnt sich, beide zu erheben. Zweitens: Die Erstlösungsquote ist die Kennzahl, die am häufigsten vergessen wird, und die, die am meisten über die Qualität verrät. Ein System, das schnell ist und dafür jede fünfte Rechnung falsch zuordnet, verschiebt die Arbeit nur in den Folgemonat.

Wir legen die Kennzahlen deshalb vor dem Start gemeinsam fest und schreiben sie in die Beauftragung. Wie eine solche Abnahme vertraglich aussieht, steht in der Wissensdatenbank unter Einkaufen und abnehmen. Wie die Messpunkte in einem Projekt zusammenspielen, zeigt unsere Seite zur Prozessoptimierung.

Ein Rechenbeispiel aus dem Rechnungseingang

Ein vereinfachtes Beispiel mit angenommenen Werten zeigt, wie aus den vier Kennzahlen eine Entscheidungsgrundlage wird. Ein Handelsunternehmen erhält 1.500 Eingangsrechnungen im Monat. Heute werden alle von Hand geprüft und gebucht, im Schnitt sechs Minuten je Rechnung.

Rechenbeispiel mit angenommenen Werten, keine Kundenzahlen.
VorherNach dem Pilot
Eingangsrechnungen im Monat1.5001.500
Anteil ohne Handgriff0 von 10070 von 100
Minuten je Rechnung mit Handgriff63
Arbeitszeit im Monat150 Stunden22,5 Stunden

Im Pilot laufen 70 von 100 Rechnungen ohne Handgriff durch: Das System liest die Rechnung, gleicht sie mit Bestellung und Wareneingang ab und bucht sie. Die übrigen 30 landen mit einem vorbereiteten Vorschlag bei der Buchhaltung, die dafür nur noch die Hälfte der Zeit braucht. Aus 150 Stunden Arbeitszeit im Monat werden 22,5 Stunden.

Diese Rechnung ist so wertvoll, weil sie sich prüfen lässt. Jede der vier Zahlen stammt aus dem Protokoll oder der Stichprobe, und jede lässt sich nach drei Monaten erneut erheben. Multipliziert mit dem internen Stundensatz entsteht daraus die Amortisation, auf deren Grundlage über den Regelbetrieb entschieden wird. Wer die Größenordnung für den eigenen Betrieb überschlagen möchte, kann das mit dem Digitalisierungsrechner tun. Worauf es beim Rechnungseingang im Einzelnen ankommt, haben wir im Beitrag Rechnungseingang automatisieren beschrieben.

Qualität messen, wo es kein eindeutiges Richtig gibt

Bei einer Rechnung ist klar, ob der Betrag stimmt. Bei einer Zusammenfassung, einer Antwort an einen Kunden oder einer Recherche ist das schwieriger. Auch hier lässt sich die Qualität belegen, mit drei Werkzeugen.

Ein fester Satz von Testfällen. Vor dem Start stellen die Fachleute aus dem Haus 50 bis 100 typische Fälle zusammen, jeweils mit der Antwort, die sie selbst geben würden. Jede neue Version des Systems läuft gegen diesen Satz. So wird sichtbar, ob eine Änderung besser oder schlechter ist, bevor sie in den Betrieb geht.

Ein Bewertungsraster für die Stichprobe. Statt „gut“ oder „schlecht“ bewerten die Prüfer drei bis vier Merkmale getrennt, etwa fachliche Richtigkeit, Vollständigkeit, Quellenangabe und Ton. Das macht die Bewertung zwischen verschiedenen Prüfern vergleichbar.

Die Übernahmequote. Wo ein Mensch den Vorschlag des Systems freigibt, ist der Anteil der unverändert übernommenen Vorschläge eine ehrliche und laufend verfügbare Kennzahl. Steigt sie, lernt das System, oder die Vorgaben passen besser. Sinkt sie, lohnt ein Blick in die Fälle.

Wie stark die Qualität von der Datengrundlage abhängt, zeigt unser Beitrag zur Datenqualität als Engpass.

Messen im laufenden Betrieb

Mit dem erfolgreichen Pilot beginnt die zweite Phase der Messung. Drei Werte behalten wir im Regelbetrieb dauerhaft im Blick.

Die vier Kennzahlen des Pilots, monatlich erhoben und mit dem Ausgangswert verglichen. So bleibt der Nutzen auch dann sichtbar, wenn sich die Beteiligten längst an den neuen Ablauf gewöhnt haben.

Die Kosten je Vorgang. Gebühren für Modelle, Infrastruktur und Pflege, geteilt durch die Zahl der Vorgänge. Diese Zahl macht Entscheidungen einfach, etwa die Frage, ob ein kleineres Modell oder ein eigener Server sich lohnt.

Die Ergebnisse auf dem Testsatz. Modelle und Daten verändern sich. Wer den Testsatz regelmäßig laufen lässt, erkennt eine nachlassende Qualität früh und kann gegensteuern. Genau diese laufende Verbesserung bestehender Systeme ist der Kern unserer KI Optimierung.

Was eine gute Messung ausmacht

Eine gute Messung ist klein. Vier Kennzahlen, die jeder im Projekt versteht, sind mehr wert als ein Dashboard mit vierzig. Sie ist früh: Der Ausgangswert entsteht vor dem ersten Eingriff. Und sie ist gemeinsam: Die Menschen, die den Ablauf heute erledigen, erheben den Ausgangswert mit und prüfen das Ergebnis.

Eine gute Messung ist außerdem ehrlich zu sich selbst. Sie zeigt nicht nur, was schneller geworden ist, sondern auch, wo nachgebessert werden muss. Genau das macht sie zur verlässlichen Grundlage für die nächste Entscheidung, sei es der Ausbau auf weitere Abläufe oder eine Anpassung am bestehenden System.

Wenn Sie für einen konkreten Ablauf in Ihrem Haus wissen möchten, welche Kennzahlen tragen und wie der Ausgangswert entsteht, ist das ein guter Einstieg in ein kostenfreies Erstgespräch. Wie wir KI-Agenten mit messbaren Aufgaben zuschneiden, steht im Beitrag KI-Agenten in der Praxis.

Quellen

Häufige Fragen

Welche Kennzahlen eignen sich, um den Nutzen eines KI-Projekts zu messen?

In fast jedem Ablauf tragen vier Kennzahlen: die Durchlaufzeit vom Eingang bis zum Abschluss, die Bearbeitungszeit, die ein Mensch je Vorgang einsetzt, die Automatisierungsquote, also der Anteil der Vorgänge ohne Handgriff, und die Erstlösungsquote, also der Anteil der Vorgänge, die beim ersten Mal vollständig richtig erledigt sind. Wo es kein eindeutiges Richtig gibt, kommen ein fester Testsatz und die Übernahmequote freigegebener Vorschläge hinzu.

Wie lange dauert es, einen Ausgangswert zu erheben?

In den meisten Unternehmen genügt eine Woche. Die Zeitstempel liefern die vorhandenen Systeme, die Bearbeitungszeit schreiben die Beteiligten fünf Arbeitstage lang selbst auf, und für die Qualität reicht eine Stichprobe aus dem Vormonat.

Wie misst man die Qualität von KI-Antworten?

Mit drei Werkzeugen: einem festen Satz von 50 bis 100 typischen Fällen mit der Antwort, die die Fachleute selbst geben würden, einem Bewertungsraster mit getrennten Merkmalen wie Richtigkeit, Vollständigkeit und Quellenangabe, und der Übernahmequote, also dem Anteil der Vorschläge, die unverändert freigegeben werden.

Was kostet es, ein KI-Projekt messbar aufzusetzen?

Die Messung ist bei uns Teil jedes Vorhabens. Das Erstgespräch ist kostenfrei, der Scoping-Workshop kostet 1.500 Euro und wird bei Beauftragung verrechnet, ein abgegrenzter Pilot mit Ausgangswert und Messpunkten beginnt bei etwa 5.000 Euro.