KI-Agenten liefern Ergebnisse – aber denken sie auch wissenschaftlich?

Corral macht sichtbar, wie KI-Agenten zu ihren Ergebnissen kommen: Der Benchmark zerlegt Agentenläufe in Hypothesen, Tests, Evidenz, Urteile und Korrekturen. So lassen sich produktive Formen wissenschaftlichen Schlussfolgerns ebenso erkennen wie problematische Muster, etwa wenn Evidenz nicht berücksichtigt wird.

Corral macht sichtbar, wie KI-Agenten zu ihren Ergebnissen kommen: Der Benchmark zerlegt Agentenläufe in Hypothesen, Tests, Evidenz, Urteile und Korrekturen. So lassen sich produktive Formen wissenschaftlichen Schlussfolgerns ebenso erkennen wie problematische Muster, etwa wenn Evidenz nicht berücksichtigt wird. © HIPOLE Jena / Corral

Ein Forschungsteam unter gemeinsamer Leitung von Kevin Maik Jablonka vom Helmholtz-Institut für Polymere in Energieanwendungen Jena (HIPOLE Jena) und N. M. Anoop Krishnan vom Indian Institute of Technology Delhi hat mit Corral einen neuen Benchmark für KI-Agenten in der Wissenschaft entwickelt. Der Preprint „AI scientists produce results without reasoning scientifically“ ist auf arXiv erschienen (https://doi.org/10.48550/arXiv.2604.18805). Die Analyse zeigt, dass aktuelle Systeme zwar wissenschaftliche Workflows ausführen und Ergebnisse liefern können; häufig folgen sie dabei aber nicht den Grundprinzipien wissenschaftlicher Prüfung und Schlussfolgerung.

Künstliche Intelligenz soll künftig nicht nur Texte schreiben oder Daten auswerten, sondern auch wissenschaftliche Experimente planen, Ergebnisse analysieren und neue Erkenntnisse gewinnen. Doch wann betreibt ein KI-System tatsächlich Wissenschaft? Reicht es, wenn am Ende ein richtiges Ergebnis steht – oder muss auch der Weg dorthin wissenschaftlichen Standards genügen? Diese Frage untersucht der neue Preprint des Teams um Jablonka.

Mit Corral haben die Forschenden einen Benchmark entwickelt, der KI-basierte wissenschaftliche Agenten nicht nur nach dem Ergebnis bewertet, sondern auch danach, wie sie zu diesem Ergebnis kommen. Dafür analysierte das Team mehr als 25.000 Agentenläufe in acht wissenschaftlichen Aufgabenfeldern – von molekularen Simulationen und Materialdatenanalyse über spektroskopische Strukturaufklärung bis hin zu hypothesengetriebenen chemischen Tests. Bewertet wurde nicht nur, ob eine Aufgabe gelöst wurde, sondern auch, ob die Systeme gesammelte Hinweise berücksichtigen, Hypothesen entwickeln und prüfen sowie ihre Annahmen bei widersprüchlichen Ergebnissen korrigieren.

„Wir müssen klarer benennen, welche Art von wissenschaftlichem Denken wir von solchen KI-Systemen erwarten“, sagt Jablonka. „Wenn es um wissenschaftliche Strenge geht, können bessere Trainingsverfahren helfen. In Bereichen, in denen wir belastbare Prozessgarantien brauchen, werden wir aber vermutlich andere Systeme benötigen – etwa mit symbolischen und formal überprüfbaren Komponenten.“

HIPOLE Jena ist ein Institut des Helmholtz-Zentrums Berlin für Materialien und Energie (HZB) auf dem Campus und in Kooperation mit der Friedrich-Schiller-Universität Jena sowie dem Center for Energy and Environmental Chemistry Jena (CEEC). Helmholtz AI hat zu dem Preprint bereits eine ausführliche Einordnung veröffentlicht: https://www.helmholtz.ai/detail/do-ai-scientists-actually-do-science-new-benchmark-probes-the-reasoning-behind-the-results-featuring-dr-kevin-maik-jablonka-helmholtz-ai-associate/

hs

  • Link kopieren

Das könnte Sie auch interessieren

  • Nanosilber als Elektrokatalysator für die CO₂-Verwertung
    Science Highlight
    24.09.2026
    Nanosilber als Elektrokatalysator für die CO₂-Verwertung
    Durch Elektrolyse lässt sich CO2 zu CO reduzieren, einem Ausgangsstoff für weitere chemische Produkte wie beispielsweise Kraftstoffe. Im Rahmen des GreenQUEST-Projekts hat ein internationales Team um den HZB-Chemiker Prashanth Menezes Katalysatorschichten aus Silbernanopartikeln systematisch untersucht und dabei sowohl die Partikelgröße als auch deren Dichte variiert. Die beste Ausbeute wurde mit Nanopartikeln mit Durchmessern von etwa 10 nm erzielt, die locker verteilt waren. Darüber hinaus zeigten sie, wie sich die Wirtschaftlichkeit der elektrochemischen Zelle durch eine zusätzliche chemische Reaktion an der Anode verbessern lässt, indem gleichzeitig wertvolle Ameisensäure, Wasserstoff und CO erzeugt wird.
  • BESSY II: Erster Film von Spinwellen im Nano-Oszillator
    Science Highlight
    23.09.2026
    BESSY II: Erster Film von Spinwellen im Nano-Oszillator
    Spin-Hall-Nano-Oszillatoren sind winzige Bauelemente auf Basis von ultradünnen CoFeB-Schichten. Sie wandeln Gleichstrom in Mikrowellensignale um und gelten als Option für eine besonders effiziente drahtlose Kommunikation oder für eine neue Technologie der Datenverarbeitung, die vom Gehirn inspiriert ist. Ein schwedisch-deutsches Team konnte nun an BESSY II zum ersten Mal die Magnetisierungsdynamik im Inneren eines solchen Spin-Hall-Nano-Oszillators abbilden, sozusagen filmen. Dazu nutzten sie die zeitaufgelöste Röntgen-Rastertransmissionsmikroskopie am MAXYMUS-Instrument. Die Abbildungen zeigen Merkmale von Spinwellen, die in den bisherigen indirekten Messverfahren nicht sichtbar waren. Die Studie ist in „Advanced Materials“ veröffentlicht.
  • Gemeinsame Power statt doppelter Strukturen:
    Nachricht
    18.09.2026
    Gemeinsame Power statt doppelter Strukturen:
    Die Berliner Wissenschaft treibt ihre Forschungsexzellenz durch den Aufbau einer leistungsfähigen, institutionenübergreifend nutzbaren Daten- und KI-Infrastruktur weiter voran. Mit einer am 18. September 2026 unterzeichneten gemeinsamen Vereinbarung ebnen die Berlin University Alliance (BUA), das Helmholtz-Zentrum Berlin (HZB) und das Zuse-Institut Berlin (ZIB) den Weg für ein gemeinsames Data-Science- und KI-Zentrum in Berlin-Dahlem und Adlershof.