Prüfung
Wie man einen Benchmark liest, ohne ihn zu glauben
Ein Benchmark ist ein Test mit einem Namen. Er versammelt Aufgaben, erwartete Antworten und eine Art, Treffer zu zählen. Das Ergebnis ist oft eine Zahl oder eine Reihung. Beides lädt dazu ein, aus dem Test ein allgemeines Urteil zu machen: besser, schlechter, bereit. Diese Notiz liest den Test als Dokument. Ein Dokument hat einen Rand. Außerhalb des Randes sagt die Zahl nichts, auch wenn sie innerhalb sehr genau wirkt.
Geglaubt wird hier nicht die Arithmetik. Geglaubt würde die stillschweigende Ausweitung: dass das Fenster des Tests die Frage abdeckt, die jemand später stellt. Diese Ausweitung steht meist nicht im Test. Sie wird vom Leser ergänzt.
Ein Test ist ein Fenster
Jede Aufgabe im Test wählt einen Ausschnitt. Eine Frage zu einem Datum, eine Umformung, eine Zuordnung zu einer Kategorie: der Ausschnitt hat Anfang und Ende. Was nicht gefragt wurde, geht nicht in die Zahl ein. Ein Modell kann im Fenster oft treffen und außerhalb desselben Fensters einen einfachen Zusammenhang verfehlen, weil dieser Zusammenhang nicht zu den Aufgaben gehörte.
Deshalb ist „besser auf diesem Test“ ein Vergleich innerhalb der Aufgaben, nicht ein Vergleich aller möglichen Fragen. Zwei Verfahren können die Reihenfolge tauschen, sobald die Aufgabenmenge wechseln. Der Tausch ist kein Skandal. Er zeigt, dass die Zahl am Fenster hängt. Dieselbe Summe in einem anderen Schnitt ist ein anderes Blatt.
Die erwartete Antwort ist eine Festlegung
Viele Aufgaben gelten nur, weil vorher festgelegt wurde, welche Antwort zählt. Bei offenen Fragen ist diese Festlegung eine Lesart. Eine andere zulässige Formulierung kann als Fehler gelten, obwohl sie den Gegenstand trifft, oder als Treffer, obwohl sie ihn verfehlt, wenn die Festlegung eng am Wortlaut hängt. Wer die Zahl liest, ohne die Festlegung zu lesen, liest ein Urteil ohne Maß.
Was die Zahl nicht enthält
Eine Gesamtzahl verbirgt, welche Aufgaben leicht und welche schwer waren. Sie verbirgt, ob die Fehler sich häufen oder streuen. Sie sagt nicht, ob die Aufgaben der Menge ähneln, mit der trainiert wurde. Eine große Nähe zwischen Übungsbeispielen und Testaufgaben macht Treffer leichter, ohne dass eine neue Frage leichter würde. Diese Nähe muss im Bericht stehen, wenn man sie beurteilen will. Steht sie nicht da, heißt sie „nicht genannt“.
- Die Zahl gilt für die Aufgaben, die gezählt wurden.
- Die erwartete Antwort ist eine Festlegung, keine Natur der Frage.
- Nähe zwischen Übung und Test ist eine eigene Angabe, kein Automatismus.
Auch die Auswahl der teilnehmenden Verfahren ist ein Rand. Wer nicht im Vergleich steht, kommt in der Reihung nicht vor. Abwesenheit ist dann keine schwache Leistung. Sie ist das Außen des Fensters. Eine Überschrift, die aus einer Reihung einen allgemeinen Rang macht, überschreitet diesen Rand.
Lesen in vier Stellen
Zuerst das Wort: Wie heißt der Test, und welche Aufgabe beschreibt der Bericht mit seinen eigenen Wörtern? Dann das Fenster: Wie viele Aufgaben, welcher Zeitraum, welcher Ausschluss? Dann die Quelle neben dem Satz: Steht die Zahl im Bericht oder nur in einer Zusammenfassung, die den Bericht nicht zeigt? Zuletzt die Lücke: Welche Frage, die Sie eigentlich hatten, kommt in den Aufgaben nicht vor?
Diese vier Stellen sind eine Lesehilfe, keine Anleitung, ein Verfahren auszuwählen. Ein höherer Wert ist keine Aufforderung, etwas zu benutzen. Ein niedrigerer Wert ist keine Aufforderung, etwas zu meiden. Beides wäre ein Auftrag, und diese Seite erteilt keine Aufträge. Sie hält fest, dass der Wert ein Fenster hat.
Reihungen und Geschichten
Aus Zahlen werden schnell Geschichten: ein Durchbruch, ein Rückstand, eine Generation. Die Geschichte fügt einen Zeitpfeil hinzu, den der einzelne Test nicht enthält. Ein späterer Test mit anderen Aufgaben ist nicht automatisch die Fortsetzung desselben Maßes. Wer die Geschichte liest, sollte das Maß danebenlegen. Fehlt das Maß, bleibt die Geschichte eine Erzählung über eine Zahl.
Erzählungen sind auf Bildungsseiten erlaubt, solange sie als Erzählung kenntlich bleiben. Sie werden irreführend, wenn sie die Zahl von ihrem Fenster lösen und daraus eine Erwartung für eine persönliche Entscheidung machen. Geldfragen, Verträge und eigene Unterlagen liegen außerhalb eines Benchmarks, auch wenn jemand den Test dafür anführt. Diese Notiz stellt die Verbindung nicht her.
Auch der Name des Tests ist eine Festlegung. Ein kurzer Name klingt nach einem ganzen Gebiet, während die Aufgaben nur einen schmalen Schnitt dieses Gebiets berühren. Wer den Namen wiederholt, ohne die Aufgaben zu nennen, verbreitet das Etikett und nicht das Maß. Zwei Berichte können denselben Namen benutzen und verschiedene Aufgaben zählen, weil eine spätere Fassung Aufgaben getauscht hat. Ohne das Datum der Fassung ist der Name mehrdeutig. Mehrdeutig heißt hier nicht rätselhaft. Es heißt, dass die Zahl ohne Fassung nicht dieselbe Zahl bleibt.
Schluss
Einen Benchmark lesen heißt, Aufgaben, Festlegung und Rand zu sehen. Ihn glauben hieße, die Zahl über diesen Rand hinaus gelten zu lassen. Die Zahl kann innerhalb des Fensters sorgfältig gezählt sein und außerhalb nichts sagen. Beides passt zusammen. Der Leser muss den Schritt über den Rand nicht mitgehen, nur weil die Zahl klar aussieht.