Wie wir KI-Meeting-Assistenten bewerten

Diese Seite erklärt konkret, was einen guten KI-Meeting-Assistenten ausmacht, mit welchen Metriken wir die Qualität der Zusammenfassungen messen und wie aus belegten Daten eine nachvollziehbare Note von 0 bis 5 wird. Ein Regelwerk, für jeden Assistenten das gleiche.

Unser Leitprinzip: Das Ergebnis ergibt sich aus den Daten, nicht die Daten aus dem gewünschten Ergebnis.

Jeder KI-Meeting-Assistent läuft durch dasselbe öffentliche Raster. Keine Extrapunkte, keine abgewerteten Wettbewerber, jede harte Aussage mit Quelle und Prüfdatum.

Was eine gute Zusammenfassung ausmacht

Bevor wir Funktionen abhaken, klären wir das Wichtigste: Wann ist das Ergebnis wirklich gut? Wir machen das an sechs messbaren Größen fest.

Transkriptionsgenauigkeit (WER)

Ist das Transkript falsch, ist alles darauf Aufbauende falsch. Die Word Error Rate (WER) misst den Anteil der Wörter, die der KI-Assistent falsch erfasst.

WER = (Ersetzungen + Auslassungen + Einfügungen) / gesprochene Wörter. Weniger ist besser.

Starkunter 10 %Brauchbar10 bis 20 %Schwachüber 20 %

Sprecher-Trennung (DER)

Eine Zusammenfassung nützt nur, wenn sie weiß, wer was gesagt und zugesagt hat. Die Diarization Error Rate (DER) misst den Anteil der Sprechzeit, der dem falschen Sprecher zugeordnet wird.

Anteil der Sprechzeit mit falscher Sprecher-Zuordnung. Zählt vor allem bei Gruppen-Calls.

Starkunter 10 %Brauchbar10 bis 20 %Schwachüber 20 %

Faktentreue (keine Halluzinationen)

Die Zusammenfassung darf nur enthalten, was wirklich gesagt wurde. Faktentreue ist der Anteil der Aussagen in der Zusammenfassung, die sich im Transkript belegen lassen. Das Gegenstück ist die Halluzinationsrate.

Belegte Aussagen / alle Aussagen. Wir belohnen KI-Assistenten, die jeden Punkt auf die genaue Stelle im Transkript zurückverlinken.

Starküber 95 % belegtBrauchbar85 bis 95 %Schwachunter 85 %

Aufgaben & Entscheidungen (Recall / Precision)

Der eigentliche Nutzen eines KI-Meeting-Assistenten ist, jede Aufgabe und Entscheidung zu erfassen, ohne welche zu erfinden. Recall = wie viele echte Aufgaben erfasst wurden. Precision = wie viele erfasste Aufgaben echt waren.

Wir prüfen die erfassten Aufgaben gegen das tatsächliche Gespräch. Hoch auf beiden Werten, nicht nur einem.

StarkRecall & Precision hochBrauchbareiner der beiden schwachSchwachverpasst oder erfindet Aufgaben

Verdichtung (Signal)

Eine gute Zusammenfassung ist kurz genug zum Überfliegen und deckt trotzdem jede Entscheidung, Aufgabe und offene Frage ab. Zu lang ist so wenig hilfreich wie zu kurz.

Abdeckung der Kernpunkte im Verhältnis zur Länge. Ausufernde Protokolle und Einzeiler verlieren beide Punkte.

Starkknapp, vollständigBrauchbarzu lang oder zu dünnSchwachverfehlt Kernpunkte

Zeit bis zum Ergebnis

Eine Zusammenfassung, die erst am Folgetag kommt, liest niemand mehr. Sie sollte direkt nach dem Call bereitstehen, idealerweise in Minuten.

Wie lange nach dem Meeting die fertige Zusammenfassung verfügbar ist.

StarkMinutenBrauchbarinnerhalb einer StundeSchwachStunden oder ein Tag

Diese Metriken sind der Maßstab. Wir können sie nicht für jeden KI-Assistenten in jeder Sprache selbst neu messen, deshalb übersetzen wir sie in die Bewertung hoch, mittel oder niedrig und stützen uns auf Anbieter-Benchmarks, Fachtests und eigene Stichproben, unter anderem auf Deutsch. Solche Werte kennzeichnen wir als indikativ.

Die sieben Bewertungsdimensionen

Jeder KI-Meeting-Assistent wird in sieben Dimensionen bewertet. Die Prozentwerte sind das Standardgewicht: wie stark eine Dimension in die Gesamtnote einfließt.

Sicherheit & Compliance25 %

Der am stärksten gewichtete Block für regulierte und datenschutzbewusste Käufer.

Aufnahme & Transkription18 %

Die Kernaufgabe: aus einem Gespräch ein präzises, lesbares Transkript machen.

KI-Aufbereitung18 %

Was der KI-Assistent aus dem Gespräch macht: Zusammenfassungen, Aufgaben und durchsuchbares Wissen.

Integrationen & Workflow15 %

Wie gut sich der KI-Assistent in die Systeme einfügt, die ein Team ohnehin nutzt.

Bedienung & Einführung9 %

Wie schnell ein nicht-technisches Team einen Nutzen aus dem KI-Assistenten zieht.

Preis & Modell8 %

Kosten und Transparenz. Ein Gratis-Tarif zählt für Einzelne; ernsthafte Teams wägen Nutzen und Klarheit ab.

Anbieter & Vertrauen7 %

Wer hinter dem KI-Assistenten steht und wie erreichbar der Anbieter ist.

Die Standardgewichte spiegeln unsere Zielgruppe: den datenschutzbewussten Mittelstand im deutschsprachigen Raum. Genau deshalb wiegt Sicherheit & Compliance am schwersten. Wer andere Prioritäten hat, kann die Gewichte über die Käuferprofile weiter unten umschalten.

Wie aus Daten eine Note wird

Die Gesamtnote wird nicht per Hand vergeben, sie wird gerechnet. In drei Schritten, reproduzierbar aus veröffentlichten Regeln und belegten Daten.

1. Jeder Wert auf 0 bis 1

Ja = 1, teilweise = 0,5, nein = 0. Enum-Werte nach fester, offener Skala. Zahlen an einer Spanne (Sprachen normalisiert, Preis invers: günstiger ist besser). Nicht bestätigt fließt nicht ein und senkt stattdessen die Datenvollständigkeit.

2. Mittelwert je Dimension

Die normalisierten Werte einer Dimension ergeben ihren Dimensionsscore von 0 bis 1, anzeigbar als Balken von 0 bis 100.

3. Gewichtete Summe zur Note

Jeder Dimensionsscore wird mit seinem Gewicht multipliziert, alles aufsummiert und auf die vertraute Skala von 0 bis 5 gebracht.

Ein Rechenbeispiel

Ein erfundener Beispiel-Assistent, der die Rechnung zeigt, ohne eine Aussage über ein echtes Produkt zu treffen. Gewicht mal Dimensionsscore, aufsummiert und auf 0 bis 5 skaliert.

DimensionGewichtScore (0–1)Beitrag
Sicherheit & Compliance25 %0,800,20
Aufnahme & Transkription18 %0,900,16
KI-Aufbereitung18 %0,750,14
Integrationen & Workflow15 %0,700,10
Bedienung & Einführung9 %0,850,08
Preis & Modell8 %0,600,05
Anbieter & Vertrauen7 %0,650,05
Summe (0–1) × 50,77 × 5 = 3,86

Das frühere handgesetzte Rating ist damit abgelöst. Niemand kann uns vorwerfen, Noten frei zu vergeben, denn sie folgen aus dem Raster.

Die Bewertungsskalen im Detail

Bei mehrstufigen Kriterien legen wir die Skala offen. Das ist exakt die Zuordnung, mit der wir rechnen.

Datenresidenz

  • EU (verpflichtend)1,00
  • EU (wählbar)0,70
  • Global0,40
  • USA0,20

Kundendaten fürs KI-Training

  • Nie1,00
  • Opt-out0,60
  • Opt-in nötig0,80
  • Ja0,00

Rechtsraum des Anbieters

  • EU1,00
  • UK0,70
  • USA0,40
  • Sonstige0,40

SOC 2

  • Typ II1,00
  • Typ I0,50
  • Konform eingeschätzt0,50
  • Nein0,00

Transkriptionsgenauigkeit

  • Hoch1,00
  • Mittel0,60
  • Niedrig0,30

Preistransparenz

  • Öffentlich1,00
  • Teilweise0,50
  • Auf Anfrage0,20

Käuferprofile: dieselben Daten, andere Gewichte

Nicht jeder gewichtet gleich. Deshalb bieten wir umschaltbare Profile. Sie ändern kein Raster und keine Rohdaten, nur die Prozente. Jeder sieht, warum sich die Reihenfolge verschiebt.

Datenschutz zuerst

Sicherheit & Compliance auf rund 40 %. Für regulierte Teams und Betriebsräte.

Vertrieb / CRM

Integrationen und CRM-Tiefe höher gewichtet, für Teams, die jeden Call ins CRM schreiben.

Preisbewusst

Preis und dauerhafter Gratis-Tarif höher gewichtet, für Einzelne und kleine Teams.

Präzision / Protokoll

Aufnahme und KI-Aufbereitung höher gewichtet, wenn das Transkript selbst das Ergebnis ist.

Belege, Datenquellen und Aktualisierung

Ein Raster ist nur so gut wie die Daten darin. Deshalb machen wir die Herkunft jeder Angabe nachprüfbar.

Datenquellen

Öffentliche Anbieter-Dokumentation, Preisseiten, Hilfecenter, Zertifikatsregister, AVV-Dokumente und eigene Stichproben. Häufig wechselnde Werte wie Preis oder Sprachzahl kennzeichnen wir als indikativ.

Belegpflicht bei harten Aussagen

Zertifizierungen, Hosting-Standort, Datennutzung und Preis-Transparenz tragen eine klickbare Quelle und ein Prüfdatum, direkt in der Vergleichstabelle sichtbar.

Datenvollständigkeit sichtbar

Fehlende Werte markieren wir als nicht bestätigt statt zu raten. Das senkt die Vollständigkeit, zieht den KI-Assistenten aber nicht heimlich nach unten und sieht nie wie ein bestätigtes Nein aus.

Regelmäßige Prüfung

Wir prüfen die Daten in Zyklen und zeigen ein Datum der letzten Prüfung (zuletzt 2026-06-01). Anbieterangebote ändern sich schnell, prüfe Details vor dem Kauf auf der Anbieterseite.

Offenlegung zum Betreiber

MeetingSummary wird von der Aliru GmbH betrieben, die auch den KI-Meeting-Assistenten Sally AI anbietet. Genau deshalb ist dieses Raster öffentlich und für jeden KI-Assistenten gleich. Sally AI wird nach denselben Kriterien und Gewichten bewertet wie jeder andere KI-Assistent, ohne Extrapunkte und ohne abgewertete Wettbewerber. Steht Sally AI bei einem Profil weit oben, dann wegen belegter Stärken wie EU-Hosting, DSGVO und Support im deutschsprachigen Raum, nicht wegen eines Daumens auf der Waage.