Der Pisa-Schock 2026: wie kann schlau.app zur Lösung beitragen?
Ein Dialog mit Claude.ai
Für Deutschlands schlechte PISA-Ergebnisse werden viele unterschiedliche Gründe genannt – und ebenso viele Lösungsansätze diskutiert.
Anfragen bei KI-Diensten wie ChatGPT, Google Gemini und Claude liefern zwar nicht automatisch bessere Antworten als menschliche ExpertInnen. Schließlich stützen sich auch diese Systeme weitgehend auf menschlich erzeugte Inhalte. Sie können jedoch die zahlreichen Beiträge bündeln und so eine Art Querschnitt durch die öffentliche und wissenschaftliche Diskussion liefern. Ein weiterer Vorteil: Im Dialog lassen sich Fragen Schritt für Schritt präzisieren und einzelne Aspekte gezielt vertiefen.
Doch was hat das mit schlau.app zu tun?
Eine ganze Menge. Mathematik gehört schließlich zu den Bereichen, in denen besonders viele Schülerinnen und Schüler Schwierigkeiten haben. schlau.app sollte also einen Beitrag zur Lösung des Matheproblems leisten können. Entscheidend ist jedoch: Wie groß kann dieser Beitrag sein – und an welchen Stellen kann die App tatsächlich etwas bewirken?
Wir beginnen mit einem allgemeinen Prompt:
Welche Gründe werden für das schlechte PISA Ergebnis in Deutschland genannt?
Hier die Chats
Im Folgenden wird die Stellungnahme von Claude in Auszügen wiedergegeben. Dem Entwickler von schlau.app ging es um die Frage, wie sich das Trainieren mit der Mathe-App auf Pisa auswirken würden, wenn viele sie nutzten - bzw. wie die App in diesem Sinn noch erweitert und optimiert werden könnte.
Es gilt also, nachzufragen, da sich zunächst Claudes Antwort nicht zu sehr von den anderen beiden AI-Diensten unterscheidet.
Konkretisiere die Antwort, bezogen auf den Mathe-Unterricht. Und versuche, die Qualität des Matheunterrichts mit den auf Mathe bezogenen Pisa-Ergebnissen in Relation darzustellen.
Aus Claudes Antwort: ....Die Pisa-Forschung selbst zieht die direkte Linie von Unterrichtsqualität zu Kompetenzergebnis – und empfiehlt "datengestützte Entwicklung des Unterrichts" als eines der wichtigsten Rezepte.
Insgesamt war die Antwort jedoch noch zu allgemein, um zu unserem Ziel zu führen.
Mache es noch praktischer: konzentriere dich auf die Sekundarstufe und Sekundarschulen. Würde das deine Aussage "Ein Drittel der Getesteten erreicht mittlerweile nicht mehr die Basiskompetenzen in Mathematik." noch verschärfen?
Claudes Hauptpunkt: Der entscheidende Hebel für Sekundarschulen – die Lehrkräfte-Qualifikation: ... Der Anteil der Lehrkräfte ohne volle Lehrbefähigung im unterrichteten Fach liegt an Gymnasien bei 7–9 %, an nichtgymnasialen Schularten bei 14–21 % – also gut doppelt so hoch.
Dia Anwort überrascht nicht, weil in den Medien oft auf Lehrermangel verwiesen wird. Primär ist es jedoch der Unterricht, der wirkt. Wie wäre es, wenn der Unterricht von ausgebildeten Lehrkräften in Sekundarschulen gar nicht signifikant besser wäre als der von Quereinsteigern? Daher die folgenden Nachfragen.
Zum Anteil der Quereinsteigerquoten. Angenommen, ausgebildete Lehrer sind im Bereich der Sekundarschulen in 30% der Fälle besser als Quereinsteiger (also in nur 70% der Fällle schlechter), dann würde in den Sekundarstufen der Unterschied der Quoten und auch die Größenordnung der Quote wenig ändern. These: im Bereich der Sekundarstufe spielt es keine Rolle, die Quereinsteigerquote nimmt unter den Gründen für Pisa nur einen nachrangigen Platz ein.
Das wird von Claude überwiegend bestätigt: Deine Überlegung ist im Kern richtig, aber sie verdient eine Präzisierung an zwei Stellen – und interessanterweise gibt es dazu tatsächlich belastbare Forschung, die deine These teilweise stützt. (...) Bei der wahrgenommenen Unterrichtsqualität zeigten sich Unterschiede in Deutsch und Mathematik. Bei der tatsächlichen Schülerleistung aber zeigte sich ein messbarer Nachteil nur im Fach Deutsch – und dort auch nur bei schulartfremd eingesetzten Lehrkräften. Für Mathematik ließ sich kein signifikanter Leistungsnachteil nachweisen.
These 2: der von den Kulturministerien verordnete Lehrplan ist nicht optimal: es wird zuwenig auf Grundlagenfestigung geachtet. Lehrer müssen die Lehrplanthemen in jedem Jahrgang durchnehmen und erliegen der Versuchung Themen als "durchgenommen" abzuhaken, obwohl sie nur teilweise verstanden wurden und die Lücken bleiben. (...)
Ein Beispiel: die Umformung a - (b - 3) = a - b + 3 wird nicht verstanden. Klassenarbeiten zu Termen werden aber trotzdem geschafft. Die Lücke bleibt und beißt sogar noch Abiturienten, z.B. bei der Vektoraddition.*
Hier geht Claude wieder vorwiegend mit: Zu deiner These gibt es tatsächlich einiges an fundierter Evidenz (...)
Interessant dabei: Die offiziellen Bildungsstandards selbst fordern eigentlich das Spiralprinzip – wiederkehrende Vertiefung statt linearem Abhaken. Das Problem liegt also weniger darin, dass der Lehrplan Grundlagensicherung explizit ausschließt, sondern darin, dass die Stofffülle das im Lehrplan angelegte Spiralprinzip in der Praxis unmöglich macht – für Wiederholung und Diagnostik bleibt schlicht keine Zeit, wenn das nächste Kapitel ansteht.
Dein Beispiel (a − (b − 3) = a − b + 3) ist kein Einzelfall, sondern gut dokumentiert: Eine Studie zu Fehlerphänomenen bei Studienanfängern (KIT, Mathe-Vorkurse) zeigt, dass genau solche Vorzeichenfehler beim Klammerauflösen zu den häufigsten dokumentierten Fehlkonzepten gehören – bei ehemaligen Abiturienten. Das deckt sich mit deiner Beobachtung zur Vektoraddition. Auch die Unterscheidung zwischen prozeduralem Wissen (Verfahren anwenden können) und konzeptuellem Wissen (verstehen, warum es funktioniert) ist in der Mathematikdidaktik ein etabliertes Konstrukt – und erklärt gut, warum Klassenarbeiten "geschafft" werden, obwohl das Verständnis fehlt: Viele Aufgabenformate lassen sich durch reines Mustererkennen lösen, ohne dass die zugrunde liegende Regel verstanden wurde.
Kurz: Die Beobachtung (Lücken bleiben, obwohl "durchgenommen") ist gut belegt und dein Beispiel dafür treffend.
Jetzt ist die Chance, schlau.app ins Spiel zu bringen:
Wenn (das) solide belegt ist, müsste dann nicht die App schlau.app, routineäßig eingesetzt, z.B. jede Woche 20 Minuten am Ende des Matheblocks, eine deutlichere Verbesserung bringen (ich setze voraus, dass du schlau.app aus den vorigen Chats gut überblickst)?
(Anm: die letzte Version von schlau.app wurde mit Claude und Claude Code weiterentwickelt)
Hier relativiert Claude: PISA misst etwas anderes als reine Verfahrenssicherheit. Pisa testet laut OECD-Rahmenkonzeption explizit nicht nur "kann den Algorithmus anwenden", sondern Modellieren und Anwenden in Kontexten. Eine App, die primär Rechenfertigkeit trainiert, würde vermutlich die Grundlage dafür stärken (weniger Fehler wie bei deiner Vektoraddition), aber der Transfer zu Pisa-artigen Anwendungsaufgaben ist ein zusätzlicher Schritt, der nicht automatisch mitfolgt. (...) Kurz: Die Grundannahme ist solide, aber "deutliche Verbesserung" würde vermutlich eher eintreten, wenn (a) die 20 Minuten wirklich zusätzliche, nicht verdrängte Zeit sind.
Jetzt wollen wir es wissen!
ok, ich frage nach mit drei Zusatzbedingungen Erstens: wie würde sich deine Antwort ändern, wenn die neue Rechenart, die gebaut, aber noch nicht in schlau.app implementiert ist?
Ich hatte bei der Entwicklung schon schlau.app nicht Pisa im Blick sondern ein besseres Bestehen der Klassenarbeiten nd Prüfungen in den Jahrgängen 7 - 10, hauptsächlich 9 und 10. Und in diesem Bereich ist z.B. der Berliner Senat bestrebt, Ergebnisse zu verschönern durch ein ständiges Erleichtern der Anforderungen. Mein Anliegen war: bessere Leistungen durch echtes Können. Zur verfügbaren Zeit: meine Beobachtung in der Sekundarstufe ist, dass die 90 Minuten eines Blocks ohnehin nicht mit voller Konzentration durchgearbeitet werden. Deshalb würden 20 Minuten Training immer zur Verfügung stehen.
Claude ist bereit, seine Vorbehalte zu überdenken: Zu Punkt 1 (neue Rechenart): Das hängt komplett davon ab, was diese Rechenart konkret leistet. Meine Einschränkung war ja nicht "mehr Übung ist nutzlos", sondern: Übung ohne Diagnose kann falsche Verfahren sogar festigen statt korrigieren. Wenn die neue Rechenart gezielt Fehlermuster wie dein a−(b−3)-Beispiel erkennt und genau diese Aufgabentypen wiederholt vorlegt, bis sie sitzen – dann verschwindet meine Einschränkung praktisch komplett, und die Sache wird zu einer sehr sauberen Umsetzung dessen, was die Fehlerforschung fordert.
Zwischenfazit unter deinen drei Bedingungen: Punkt 2 und 3 räumen meine ursprünglichen Einschränkungen weitgehend aus. Punkt 1 ist der entscheidende verbleibende Hebel – wenn die neue Rechenart wirklich diagnostisch/fehlerspezifisch arbeitet, würde ich sagen: Ja, unter diesen Bedingungen sollte eine routinemäßige 20-Minuten-Nutzung eine deutliche Verbesserung der echten Kompetenz in Klassenarbeiten bringen, nicht nur eine marginale.
ok, zu Punkt 1, und dann gib mir die aktualisierte Bewertung mit Berücksichtigung der entkräfteten Einwände.
Die Rechenart wäre "a-+(b-c)". Der Button wäre rechts vom Button "a-(-+b)". Es wäre genau wie beiden anderen Aufgabentypen möglich, per Zufall 50/50 minus- und plus klammern zu rechnen.
Der Rechenweg wäre unter "?" sichtbar und im Explainer könnten kontextabhäng auch typische Falsch-Alternativen aufgezeigt werden bzw. es könnte davor gewarnt werden.
Es wäre auch möglich, so wie bei anderen Rechenarten ein Dropdown-Menü für verschiedene Fälle zu machen, z.B. a/2 - (b+a)/2, wo es also darum geht auch den Bruchstrich wie eine Klammer zu behandeln.
Eine weitere Option könnte die Auflösung von verschachtelten Klammern sein.
Ein Praxisbeispiel könnte eine Gerade durch 2 Punkte sein: y - y1 = (y2-y1)/(x2+x1) * (x - x1)
Diese Rechenart würde also die Sicherheit beim Rechnen mit allen möglichen Klammer-Konstellationen vergrößern.
Unter diesen Bedingungen würde ich sagen: Ja, eine routinemäßige wöchentliche Nutzung dieser Rechenart sollte eine deutlich messbare Verbesserung der tatsächlichen Kompetenz in Klassenarbeiten bringen – nicht nur eine marginale. Das ist kein vages "könnte helfen" mehr, sondern eine Intervention, die ziemlich genau das umsetzt, was die Forschung zu Fehlkonzepten und Retrieval Practice als wirksam beschreibt. Ein einfacher Weg, das auch empirisch zu prüfen, wäre ein Vorher-Nachher-Vergleich der Fehlerquote bei genau diesem Fehlertyp zwischen einer Klasse mit und einer ohne regelmäßige Nutzung – das wäre mit überschaubarem Aufwand belastbar messbar, im Gegensatz zu Pisa-Effekten.
(mehr am Ende des Original-Chats lesen)
Sobald es im AI-Interview gelang, eine konkrete Rechenart in die Diskussion einzubringen, war Claude bereit, alle Vorbehalte und Relativierungen aufzugeben, und stimmt klar für den Einsatz von schlau.app, um die Mathe-Leistungen - und damit das Pisa-Ergebnis - zu verbessern.
Interessante Parallele zum Gespräch mit Entscheidern im Schulsystem, z.B. mit Schulleitungen: es ist schwer, für Grundlagen-Training eine Lanze zu brechen, da die Ansprechpartner diese Dinge aus eigenem Erleben nicht kennen. Vielleicht haben sie selbst als Schüler Matheprobleme gehabt. Sie können den Prozess, wie Schüler durch erfolgreiches Einüben von echtem Können souverän werden, nicht nachvollziehen. Es bleibt im Vagen: "Grundlagen verbessern? Klar, machen wir, steht auch im Lehrplan."
In Kürze werden neue Rechenarten (also weitere Buttons) in schlau.app eingebaut. Hier ein Beispiel: Klammern auflösen