Für die Suche nach Inhalten geben Sie »Content:« vor den Suchbegriffen ein, für die Suche nach Orten geben Sie »Orte:« oder »Ort:« vor den Suchbegriffen ein. Wenn Sie nichts eingeben, wird in beiden Bereichen gesucht.

 

 

ROSA, Kunst, Kultur, Orte

Wenn »ChatGPT« auf die WM tippt: eine neue Live Benchmark für Sprachmodelle?Zoom Button

Informationen zu Creative Commons (CC) Lizenzen, für Pressemeldungen ist der Herausgeber verantwortlich, die Quelle ist der Herausgeber

Wenn »ChatGPT« auf die WM tippt: eine neue Live Benchmark für Sprachmodelle?

Wenn »#ChatGPT« auf die #WM tippt: eine neue #Live #Benchmark für #Sprachmodelle?

#Paderborn, 15. Juni 2026

Kann ein Sprachmodell wie »ChatGPT« einschätzen, ob die deutsche #Nationalmannschaft die Fußball Weltmeisterschaft gewinnt? Was zunächst wie eine Frage für Fußballfans klingt, bietet aus wissenschaftlicher Sicht eine besondere Möglichkeit: Die Vorhersagen großer Sprachmodelle, sogenannter Large Language Models (#LLMs), lassen sich in einem realen Entscheidungskontext evaluieren. Denn anders als bei vielen abstrakten Testaufgaben zeigt sich bei Fußballprognosen später eindeutig, ob eine Vorhersage richtig war. Im Projekt »#LLM #SoccerArena« untersucht ein Team der Universität Paderborn, der Ludwig Maximilians Universität München (#LMU) sowie der Universität zu Köln, wie gut große Sprachmodelle reale Informationen verarbeiten und Vorhersagen unter Unsicherheit treffen können.

Viele etablierte Benchmarks für große Sprachmodelle testen abstrakte Aufgaben in stark vereinfachten oder statischen Umgebungen. Solche Tests sind wichtig, stoßen aber zunehmend an Grenzen. Medizinische Examensfragen, juristische Aufgaben oder #MBA Tests werden von vielen modernen Modellen mittlerweile häufig sehr gut gelöst. Zugleich sagen solche Aufgaben nur begrenzt etwas darüber aus, wie zuverlässig Modelle in echten Entscheidungssituationen unter Unsicherheit agieren. Hier setzt die Idee von »LLM SoccerArena« an. Wie in einem Tippspiel geben Modelle Vorhersagen ab, die sich erst später anhand realer Ergebnisse überprüfen lassen.

Das Projekt untersucht, wie gut große Sprachmodelle wie »ChatGPT«, »#Claude« oder »#Mistral« Ergebnisse realer Fußballspiele prognostizieren können. Die Plattform umfasst ein Live Leaderboard, das täglich aktualisiert wird, sowie eine Übersicht aller Modellvorhersagen. »Wir interessieren uns nicht nur dafür, welches Modell am Ende richtig liegt«, sagt Prof. Dr. Stefan Feuerriegel von der LMU. »Entscheidend ist, wie ein Modell zu seiner Vorhersage kommt: Welche Informationen sucht es? Welche berücksichtigt es? Und kann es relevante Signale von bloßen Popularitätsmustern unterscheiden?«

Die Erkenntnisse sind auch für die #Management #Forschung relevant. Führungskräfte nutzen große Sprachmodelle zunehmend, um Marktinformationen zu strukturieren, Szenarien zu bewerten oder Prognosen vorzubereiten, etwa zu strategischen Entscheidungen, Wettbewerbern, Produkteinführungen oder Risiken. In solchen Fällen hängt die Qualität der Antwort nicht nur vom logischen Denken ab. Modelle müssen auch Informationen über die reale Welt erfassen und einordnen, wie etwa die Relevanz und Aktualität von Informationen sowie die die Zuverlässigkeit von Quellen und abgeleiteten Einschätzungen.

Eine ähnliche Herausforderung stellt sich bei »LLM SoccerArena«. Für eine gute Fußballprognose reicht es nicht, allgemeines Fußballwissen abzurufen. Ein Modell muss Informationen zur aktuellen Form, zu Verletzungen, Trainer*innenentscheidungen, vergangenen Begegnungen, Kaderqualität oder Wettquoten einordnen und daraus eine überprüfbare Prognose ableiten. Die Plattform nutzt Fußballspiele damit als realitätsnahes Testfeld für die Frage, wie gut große Sprachmodelle in echten Entscheidungssituationen abschneiden. »Der große Vorteil von LLMs im Vergleich zu statistischen Vorhersagemodellen ist, dass LLMs flexibel auf neue und auch unstrukturierte Informationen reagieren können. Zum Beispiel Gerüchte aus den Social Media«, erläutert Prof. Dr. Oliver Müller, Professor für Wirtschaftsinformatik an der Universität Paderborn und Direktor des Kompetenzbereichs »Artificial Intelligence« im Software Innovation Lab des #SICPSoftware Innovation Campus Paderborn.

Fußball bietet für diese Fragen ein besonders interessantes Forschungsfeld. In der Management Forschung wird Fußball häufig genutzt, weil so reale Entscheidungen unter vergleichsweise strukturierten Konditionen getroffen und evaluiert werden können. Spiele finden zu klar definierten Zeitpunkten statt, Entscheidungen und Ereignisse sind öffentlich sichtbar und das Ergebnis, also der Erfolg einer Mannschaft, ist kurze Zeit später eindeutig messbar. Dadurch lässt sich systematisch untersuchen, ob Vorhersagen tatsächlich zutreffen und welche Modelle unter welchen Bedingungen besser abschneiden.

Das Projekt vergleicht dabei zwei Ansätze: Zum einen geben Modelle Prognosen auf Basis ihres internen Wissens ab. Zum anderen wird getestet, wie gut Modelle zusätzliche externe Informationen aus dem Internet abrufen und verarbeiten können. Das ist nicht trivial, denn im Internet finden sich nicht nur zuverlässige und aktuelle Informationen. Bei dieser sogenannten agentischen Suche stellt sich daher zunächst die Frage, ob ein Sprachmodell überhaupt die richtigen Informationen recherchiert. Prüft es aktuelle Verletzungen, Startaufstellungen, Formkurven, Trainer*innenwechsel, direkte Duelle, Turnierkontext oder Wettquoten? Danach muss es diese Informationen sinnvoll gewichten. Eine hohe Wettquote, eine prominente Mannschaft oder ein einzelnes starkes Spiel einer Mannschaft können irreführend sein.

Und welche Mannschaft gewinnt nun die Weltmeisterschaft? In den aktuellen Vorhersagen der Modelle prognostizieren »GPT 5.5« von »#OpenAI« und »Claude Opus 4.8« #Spanien als Weltmeister, während »Mistral Large« #Frankreich voraussagt. Mit den ersten realen Ergebnissen kann gemessen werden, welche Modelle zuverlässiger in der Aufgabenstellung sind.

Auch die Unterschiede zwischen den Vorhersagen sind wissenschaftlich interessant. »Eine mögliche Erklärung für unterschiedliche Prognosen liegt in den Trainingsdaten der Modelle«, sagt Prof. Dr. Markus Weinmann, Professor für Business Analytics an der Universität zu Köln. »Modelle können dazu neigen, verbreitete Internetmeinungen oder Muster aus ihren Trainingsdaten zu reproduzieren.« Teams mit großer globaler Sichtbarkeit oder besonders vielen Erwähnungen im Internet könnten dadurch systematisch bevorzugt werden. Auch die Sprache und Herkunft der Trainingsdaten können eine Rolle spielen. Wenn ein Modell besonders viele Texte aus einem bestimmten Sprachraum verarbeitet hat, kann sich das auf seine Einschätzungen auswirken. Das könnte ein Grund sein, weshalb Mistral, als Sprachmodell einer französischen Firma, vermutlich auf Frankreich tippt.

Damit ist »LLM SoccerArena« mehr als ein spielerischer Vergleich von Fußballtipps. Das Projekt bietet einen Live Benchmark für reale Entscheidungs und Prognoseaufgaben: Es ist konkret keine Wettempfehlung, sondern macht sichtbar, wie gut große Sprachmodelle Informationen unter Unsicherheit suchen, bewerten und in überprüfbare Vorhersagen übersetzen können.

Weitere Informationen sowie die Ergebnisse des Projekts sind online zu finden.

#NOW #N #KWS #ROSA #OWL #GT #GGC #GOGREENCHALLENGE #VISITGÜTERSLOH #VISITGT #NIEWIEDERISTJETZT

Content im NOW Magazine …

Universität Paderborn, mehr …
Warburger Straße 100
33098 Paderborn
Telefon +495251600
E-Mail [email protected]
www.uni-paderborn.de

 
NOW
Termine und Events

Veranstaltungen
nicht nur in Gütersloh und Umgebung

September 2026
So Mo Di Mi Do Fr Sa
12345
6789101112
13141516171819
20212223242526
27282930
November 2026
So Mo Di Mi Do Fr Sa
1234567
891011121314
15161718192021
22232425262728
2930
Dezember 2026
So Mo Di Mi Do Fr Sa
12345
6789101112
13141516171819
20212223242526
2728293031
Februar 2027
So Mo Di Mi Do Fr Sa
123456
78910111213
14151617181920
21222324252627
28
September 2027
So Mo Di Mi Do Fr Sa
1234
567891011
12131415161718
19202122232425
2627282930
November 2027
So Mo Di Mi Do Fr Sa
123456
78910111213
14151617181920
21222324252627
282930
Dezember 2027
So Mo Di Mi Do Fr Sa
1234
567891011
12131415161718
19202122232425
262728293031
Februar 2028
So Mo Di Mi Do Fr Sa
12345
6789101112
13141516171819
20212223242526
272829
März 2028
So Mo Di Mi Do Fr Sa
1234
567891011
12131415161718
19202122232425
262728293031
April 2028
So Mo Di Mi Do Fr Sa
1
2345678
9101112131415
16171819202122
23242526272829
30
September 2029
So Mo Di Mi Do Fr Sa
1
2345678
9101112131415
16171819202122
23242526272829
30
Dezember 2030
So Mo Di Mi Do Fr Sa
1234567
891011121314
15161718192021
22232425262728
293031
November 2042
So Mo Di Mi Do Fr Sa
1
2345678
9101112131415
16171819202122
23242526272829
30