Leistungsfähigkeit grosser Sprachmodelle bei der Literaturrecherche in der Ophthalmologie
Grosse Sprachmodelle (Large Language Models, LLMs) wie ChatGPT werden zunehmend zur Recherche medizinischer Fachliteratur eingesetzt. Ihre Fähigkeit, relevante Studien zuverlässig zu identifizieren, ist jedoch bislang nur unzureichend untersucht, insbesondere in der Ophthalmologie, wo viele Erkrankungen selten sind und eine hochspezialisierte Terminologie verwendet wird. In dieser Untersuchung wurden fünf frei zugängliche LLMs anhand von fünf bereits abgeschlossenen Literaturübersichten als Referenzstandard bewertet. Jedes Modell erhielt die Aufgabe, mithilfe einer einfachen natürlichsprachlichen Anfrage sämtliche Publikationen zu einem definierten Thema zu identifizieren. Die Leistungsfähigkeit wurde anhand von Recall, Präzision und F1-Score beurteilt. Insgesamt erreichten die LLMs einen niedrigen Recall (0,16–0,41), jedoch eine hohe Präzision (0,78–1,00). Dies bedeutet, dass die gefundenen Arbeiten überwiegend relevant waren, gleichzeitig jedoch viele geeignete Studien nicht identifiziert wurden. ChatGPT Deep Research erzielte den höchsten Recall sowie den besten F1-Score, während ChatGPT Auto und Deep Research bei allen untersuchten Themen eine perfekte Präzision erreichten. Die Leistung variierte je nach Thema: Bei seltenen, klar abgegrenzten Fragestellungen war der Recall höher als bei breiter angelegten Literaturübersichten. Zusätzliche Studien, die über die konventionelle Datenbankrecherche hinausgingen, konnten durch die LLMs nicht identifiziert werden. Halluzinierte Literaturangaben traten praktisch nicht auf. Die wenigen fehlerhaften Zitate bezogen sich vielmehr auf thematisch verwandte, aber nicht relevante Publikationen als auf frei erfundene Referenzen. Dies deutet darauf hin, dass moderne LLMs Literaturangaben deutlich zuverlässiger generieren als frühere Modellgenerationen.
Insgesamt eignen sich LLMs gut, um Ärztinnen und Ärzten einen schnellen Überblick über ein unbekanntes Themengebiet zu verschaffen. Für eine vollständige und systematische Literaturrecherche, wie sie für systematische Reviews oder Leitlinien erforderlich ist, sind sie derzeit jedoch nicht geeignet. Trotz der begrenzten Anzahl untersuchter Themen verdeutlichen die Ergebnisse sowohl das Potenzial als auch die aktuellen Grenzen der LLM-gestützten Literaturrecherche.
Quellen:
Paris J, Kleinig O, Agarwal A, Chan WO, Selva D. Performance of large language models for ophthalmic literature retrieval. Eye (Lond). 2026 Aug;40(11):1759-1760. doi: 10.1038/s41433-026-04586-y. Epub 2026 Jun 12. PMID: 42286134; PMCID: PMC13415870.