Zuletzt aktualisiert am 28. Juli 2026
Die Prüfung ISTQB Certified Tester AI Testing (CT-AI) v2.0 umfasst 40 Fragen mit insgesamt 44 Punkten; zum Bestehen brauchen Sie 29 Punkte — 65 % — in 60 Minuten. CTFL ist Voraussetzung. Dieser Leitfaden arbeitet mit dem veröffentlichten v2.0-Lehrplan und der offiziellen Prüfungsstruktur und benennt eines deutlich, das die meisten Vorbereitungsmaterialien übergehen: Für CT-AI veröffentlicht das ISTQB keine Fragenanzahl pro Kapitel.
40 Fragen, 44 Punkte — eine Mischung aus Ein- und Zwei-Punkte-Fragen. Die höher gewichteten liegen auf den höheren kognitiven Stufen, auf denen Sie anwenden oder analysieren statt sich zu erinnern.
29 von 44 Punkten zum Bestehen — 65 %. Da die Gewichtung unterschiedlich ist, führt das Zählen von Fragen statt Punkten in die Irre: Vier verpasste Zwei-Punkte-Fragen kosten so viel wie acht verpasste Ein-Punkte-Fragen.
60 Minuten, oder 75 Minuten mit dem üblichen Zuschlag von 25 %, wenn Sie die Prüfung nicht in Ihrer Muttersprache ablegen.
CTFL ist Pflicht — dies ist die ISTQB-Spezialistenprüfung, bei der Kandidaten die Voraussetzung am häufigsten zu spät entdecken. Ein Data-Science-Abschluss oder ein Programmiertest ist nicht erforderlich.
Eine unbeantwortete Frage zählt genauso wie eine falsche — lassen Sie daher keine aus.
v2.0 ist nicht um KI-Theorie herum aufgebaut, sondern um den Lebenszyklus eines KI-basierten Systems. Sieben Bereiche:
Einführung in künstliche Intelligenz — was als KI gilt, schwache versus starke KI, KI-Technologien und der Stand des Felds einschließlich generativer KI.
Qualitätsmerkmale KI-basierter Systeme — die KI-spezifischen Merkmale der ISO/IEC 25059 (Flexibilität, Anpassungsfähigkeit, Autonomie, Transparenz, Erklärbarkeit, Robustheit, Bias) und wie Akzeptanzkriterien für ein probabilistisches System formuliert werden.
Maschinelles Lernen — überwachtes, unüberwachtes und verstärkendes Lernen, Daten für ML, funktionale Performance-Metriken für Klassifikation und neuronale Netze.
Testen KI-basierter Systeme — das Testorakel-Problem bei Nicht-Determinismus, das Testen generativer KI und großer Sprachmodelle sowie die Veränderung der Teststufen bei ML-Systemen.
Testen der Eingabedaten für ML-Systeme — eine Teststufe, die es außerhalb von ML nicht gibt.
Modelltest für ML-Systeme — die zweite ML-spezifische Teststufe.
Testen der ML-Entwicklung — das Testen der Pipeline, die das Modell erzeugt.
Nun der ehrliche Teil. Für CTFL veröffentlicht das ISTQB eine Prüfungsstruktur-Tabelle, die genau angibt, wie viele Fragen aus jedem Kapitel kommen. Für CT-AI nicht. Wer Ihnen sagt, „Kapitel 3 ist acht Fragen wert“, hat die Zahl erfunden. Planen können Sie anhand der Form des Lehrplans: Die drei ML-spezifischen Testbereiche plus das Kapitel zum maschinellen Lernen tragen den größten Teil des anwendungsorientierten Stoffs, und dort zahlt sich Vorbereitung aus.
Metrik-Rechnen unter Zeitdruck. Berechnen Sie aus einer Confusion Matrix Precision, Recall und F1 und sagen Sie, welche davon für das genannte Ziel maßgeblich ist. Lernen Sie, die Matrix in der Ausrichtung der Prüfung zu lesen, nicht nur in der Ihres Lehrbuchs, und beherrschen Sie das Accuracy-Paradox: 99 % Accuracy bei einem Problem mit seltener Klasse kann bedeuten, dass das Modell die seltene Klasse nie vorhersagt.
Verwechseln der zwei ML-spezifischen Teststufen. Das Testen der Eingabedaten betrachtet die Daten vor dem Training — Vollständigkeit, Labeling-Qualität, Leakage, Repräsentativität. Der Modelltest betrachtet das Verhalten des trainierten Modells. Fragen beschreiben einen Fehlerzustand und wollen wissen, welche Teststufe ihn hätte finden müssen.
Das Testorakel-Problem. Bei einem nicht-deterministischen System gibt es oft kein einzelnes erwartetes Ergebnis — genau deshalb existieren metamorphes Testen, Back-to-Back-Testen und A/B-Vergleiche. Antwortoptionen, die von einem festen erwarteten Ergebnis ausgehen, sind meist der Distraktor.
Besonderheiten generativer KI. Prompt Injection versus Jailbreaking, Groundedness und Halluzination, Red Teaming, warum derselbe Prompt unterschiedliche Antworten liefern kann und was ein Evaluations-Set für ein Retrieval-Augmented-System tatsächlich misst.
Bias-Vokabular. Algorithmischer Bias, Sample Bias, unangemessener Bias und historischer Bias sind verschiedene Dinge mit verschiedenen Gegenmaßnahmen, und die Prüfung unterscheidet sie.
Bereiche 1 und 2. Bauen Sie sich ein eigenes Glossar: eine Zeile pro Begriff, in Ihren Worten. Wenn Sie ohnehin mit ML arbeiten, wirkt diese Woche trivial — machen Sie es trotzdem, denn geprüft wird das Vokabular der ISO/IEC 25059, nicht das Ihres Teams.
Bereich 3, und diese Woche entscheidet das Ergebnis. Zeichnen Sie Confusion Matrices von Hand, bis Precision, Recall und F1 in unter einer Minute herauskommen. Rechnen Sie mindestens fünf Zahlenbeispiele, darunter eines, in dem die Accuracy hoch und der Recall miserabel ist. Lesen Sie dann über neuronale Netze nur so tief, wie der Lehrplan es verlangt: Struktur und Auswirkungen auf das Testen, nicht die Mathematik der Backpropagation.
Bereiche 4 bis 7 in der ersten Wochenhälfte, wobei Sie die zwei ML-spezifischen Teststufen in Ihren Notizen klar getrennt halten. Wechseln Sie dann vollständig zu Mock-Prüfungen mit 40 Fragen unter Zeit — mindestens drei, an verschiedenen Tagen. 48 Stunden vorher kein neuer Stoff mehr; lesen Sie stattdessen Ihr Glossar und Ihre Fehlerliste erneut.
ExamCaliber hat 5 CT-AI-Mock-Prüfungen aus einem Pool von 220 eigenen Fragen, jede Mock-Prüfung mit 40 Fragen in 60 Minuten und einer Bestehensgrenze von 65 %, mit einer schriftlichen Begründung zu jeder Option, auch zu den falschen. Lesen Sie die Begründung zu den Optionen, die Sie nicht gewählt haben — das ist es, was auf die nächste Frage übertragbar ist.
Die Einschränkung: unsere Mock-Prüfungen gewichten jede Frage mit einem Punkt, während die echte Prüfung Ein- und Zwei-Punkte-Fragen über 44 Punkte mischt. Lesen Sie Ihr Ergebnis daher als Prozentwert, nicht als Punktzahl, und versuchen Sie nicht, „ich hatte 30“ auf die echte Grenze von 29 von 44 abzubilden. Wir schreiben das offen, statt stillschweigend zu suggerieren, unsere Bewertung sei identisch.
Beginnen Sie mit einer der CT-AI-Mock-Prüfungen, oder lesen Sie eine komplette Mock-Prüfung als Lernblatt auf ihrer Fragen-und-Antworten-Seite.
Das sind unterschiedliche Zertifizierungen, und Leute buchen die falsche. Bei CT-AI geht es um das Testen KI-basierter Systeme — Sie sind der Tester, die KI ist das Testobjekt. Bei CT-GenAI geht es darum, generative KI zur Unterstützung des Testens einzusetzen — die KI ist Ihr Werkzeug. Wenn Ihre Aufgabe darin besteht, ein Modell abzusichern, das jemand anders trainiert hat, wollen Sie CT-AI.
Stellen Sie sicher, dass Sie v2.0 lernen. v1.0 wird ausgemustert — die englische Version ist noch bis zum 21. April 2027 verfügbar, nicht-englische Versionen bis zum 21. Oktober 2027 — und v2.0 hat den Stoff erheblich umstrukturiert, sodass eine v1.0-Fragensammlung Themen prüft, die verschoben wurden oder weggefallen sind.
Fordern Sie den Zeitzuschlag von 25 % bei der Buchung an, wenn er für Sie gilt. Er wird dann gewährt, nicht erst vor Ort.
Die Gebühr legt Ihr nationales Member Board oder Ihr Prüfungsanbieter fest, nicht das ISTQB — sie unterscheidet sich daher von Land zu Land.
Unsere Fragen sind eigenständig formuliert, auf Basis des veröffentlichten v2.0-Lehrplans. Es sind keine echten Prüfungsfragen, und wer Ihnen solche anbietet, bietet etwas an, das das ISTQB nicht herausgibt. Eine brauchbare Messlatte für Bereitschaft: 80 % oder besser in drei verschiedenen Mock-Prüfungen, unter Zeit, ohne dass ein Themenbereich dauerhaft unter 65 % liegt.