Forscher und Arzneimittelentwickler können nun Viren, die die größten Risiken für die öffentliche Gesundheit darstellen, in größerem Umfang und schneller untersuchen. Modelle zur Wechselwirkung von Virusproteinen sind für 2.800 den Menschen infizierende Viren und deren Verwandte öffentlich zugänglich – zuvor waren es nur eine Handvoll –, zusammen mit den ersten jemals vorhergesagten 3D-Strukturen von fast 7.800 viralen Proteinen. Das SIB war an der Auswahl der von der AlphaFold-KI analysierten Viren beteiligt, stellte einzigartige Proteindaten für 699 Viren zur Verfügung und führte eine Qualitätskontrolle der vorhergesagten Wechselwirkungen dieser Proteine durch. Die Arbeit ist das Ergebnis einer internationalen Zusammenarbeit, an der unter anderem das EMBL-EBI, NVIDIA, Google DeepMind, die Seoul National University und die University of Glasgow beteiligt sind. Sie erweitert die Beiträge des SIB zum mit dem Nobelpreis ausgezeichneten AlphaFold und zur Bekämpfung von Infektionskrankheiten.

AlphaFold: eine mit dem Nobelpreis ausgezeichnete KI, die unter Verwendung von SIB-Ressourcen entwickelt wurde

AlphaFold ermöglichte es, die 3D-Struktur eines Proteins schnell anhand seiner Aminosäuresequenz zu berechnen, anstatt langwierige und kostspielige experimentelle Verfahren durchzuführen. Spätere Modelle erweiterten dies auf die Vorhersage von Wechselwirkungen zwischen Proteinen und anderen Molekülen.

Die Entwicklung von AlphaFold – die 2024 mit dem Nobelpreis für Chemie gewürdigt wurde – stützte sich auf drei offene Ressourcen und Initiativen, die von SIB-Wissenschaftlern entwickelt bzw. mitentwickelt wurden. UniProt stellte hochwertige, frei zugängliche Trainingsdaten und Wissen zu Millionen von Proteinen bereit , während der CASP-Wettbewerb und die CAMEO-Ressource die beeindruckende Genauigkeit der KI bzw. ihre Anwendbarkeit auf alle menschlichen Proteine bestätigten.

Mehr dazu

Schließung einer Datenlücke für die Bereitschaft im Falle eines Ausbruchs

Die Entwicklung von Virusdiagnostika, Impfstoffen und Therapien hängt davon ab, dass man die 3D-Struktur viraler Proteine kennt und weiss, wie diese Proteine miteinander interagieren. Die beispiellose Geschwindigkeit bei der Entwicklung von Impfstoffen gegen SARS-CoV-2 war beispielsweise nur dank jahrzehntelanger Forschung an ähnlichen Viren vor der Pandemie möglich.

AlphaFold: eine mit dem Nobelpreis ausgezeichnete KI, die unter Verwendung von SIB-Ressourcen entwickelt wurde

AlphaFold ermöglichte es, die 3D-Struktur eines Proteins schnell anhand seiner Aminosäuresequenz zu berechnen, anstatt langwierige und kostspielige experimentelle Verfahren durchzuführen. Spätere Modelle erweiterten dies auf die Vorhersage von Wechselwirkungen zwischen Proteinen und anderen Molekülen.

Die Entwicklung von AlphaFold – die 2024 mit dem Nobelpreis für Chemie gewürdigt wurde – stützte sich auf drei offene Ressourcen und Initiativen, die von SIB-Wissenschaftlern entwickelt bzw. mitentwickelt wurden. UniProt stellte hochwertige, frei zugängliche Trainingsdaten und Wissen zu Millionen von Proteinen bereit , während der CASP-Wettbewerb und die CAMEO-Ressource die beeindruckende Genauigkeit der KI bzw. ihre Anwendbarkeit auf alle menschlichen Proteine bestätigten.

Mehr dazu

Bei 80 % der Viren fehlen diese Erkenntnisse. Dies liegt an den Kosten und dem Zeitaufwand für experimentelle Untersuchungen sowie daran, dass sich manche Viren im Labor nicht züchten lassen.

Das KI-Modell AlphaFold (siehe Kasten) überwindet diese Einschränkung, indem es 3D-Proteinstrukturen anhand von Aminosäuresequenzen präzise vorhersagt. Im Rahmen einer internationalen öffentlich-privaten Zusammenarbeit wurde AlphaFold nun eingesetzt, um Wechselwirkungen zwischen Protein-Protein-Paaren in 2.800 Viren vorherzusagen, die alle zu Familien gehören, von denen bekannt ist, dass sie Menschen infizieren.

Die Zusammenarbeit – an der das Europäische Institut für Bioinformatik des Europäischen Labors für Molekularbiologie (EMBL-EBI), NVIDIA, Google DeepMind, der Seoul National University, der University of Glasgow, dem SIB, der Coalition for Epidemic Preparedness Innovations (CEPI) und der Sungkyunkwan University – vereinte Fachwissen aus den Bereichen Virusbiologie, Strukturbiologie, Biokuration, Datenmanagement und -analyse sowie KI und stellte zudem die für Vorhersagen dieser Größenordnung erforderliche Rechenleistung bereit.

Die Beiträge des SIB umfassten:

  • die gemeinsame Auswahl der zu analysierenden Referenzviren zusammen mit der Universität Glasgow;
  • Bereitstellung einzigartiger Daten zu Polyproteinen – komplexen Vorläuferproteinen, die von 47 % der den Menschen infizierenden Viren produziert werden, darunter Zika, Dengue und Poliovirus;
  • die Validierung der Plausibilität der Strukturvorhersagen von AlphaFold für diese Proteine unter Rückgriff auf das umfassende, kuratierte Wissen zur Virusbiologie, das in der SIB-Ressource „ViralZone“ gesammelt wurde.

Dadurch war AlphaFold erstmals in der Lage, die 3D-Strukturen und wahrscheinlichen Wechselwirkungen von fast 7.800 viralen Proteinen zu modellieren, die aus Polyproteinen stammen (mehr dazu weiter unten).

Alle Daten wurden heute in der AlphaFold-Datenbank öffentlich zugänglich gemacht – zeitgleich mit einer Sitzung der Generalversammlung der Vereinten Nationen zum Thema Pandemievorsorge, -vorbereitung und -bewältigung, die diese Woche in New York City stattfindet. Erste Analysen deuten bereits auf bisher unbekannte Arten von Wechselwirkungen zwischen viralen Proteinen hin, was Auswirkungen auf die therapeutische Forschung und den Einsatz viraler Proteine als biotechnologische Werkzeuge hat.

Die Arbeit trägt zur Mission des SIB bei, die Grenzen der Datenwissenschaft durch fundierte Kenntnisse biologischer Daten zu erweitern, Forschern und Klinikern hervorragende Ressourcen zur Verfügung zu stellen und Wissen zu generieren, das Innovationen für eine bessere Zukunft ermöglicht.

Erstellung von Basisdaten zu Viren, die für die menschliche Gesundheit relevant sind

Viren sind ausserordentlich vielfältig, was ihre Erforschung zu einer Herausforderung macht. Polyproteine sorgen für zusätzliche Komplexität. Diese langen Aminosäureketten werden in verschiedene aktive Proteine gespalten – deren genaue Sequenzen äusserst schwer zu bestimmen sind. Das liegt daran, dass verschiedene Viren völlig unterschiedliche Mechanismen zur Spaltung ihrer Polyproteine entwickelt haben, sodass es keinen gemeinsamen genetischen Anhaltspunkt gibt, der Aufschluss darüber gibt, wo diese Spaltstellen liegen.

Wissenschaftler des SIB haben als Erste solche Spaltstellen in viralen Polyproteinen kartiert. Mögliche Spaltstellen wurden in einem halbautomatisierten Verfahren identifiziert, das computergestützte Werkzeuge, umfangreiche Literaturrecherchen und fundiertes Fachwissen in der Virusbiologie kombinierte. Die Genauigkeit der vorhergesagten Spaltstellen wurde anschließend durch Strukturmodellierung bestätigt, die zeigte, ob die resultierenden gespaltenen Proteine biologisch plausibel waren.

Die im Mai dieses Jahres abgeschlossene Arbeit lieferte die ersten zuverlässigen Proteinsequenzdaten für 7.783 aktive Proteine, die aus Polyproteinen von 699 Viren stammen, welche alle zu Familien gehören, von denen bekannt ist, dass sie Menschen infizieren. Sie war Teil eines Projekts des Pathogen Data Network, das vom SIB mitkoordiniert und von den US-amerikanischen National Institutes of Health unterstützt wurde.

Neue Erkenntnisse über Viren offen für Forscher und KI zugänglich machen

Aufgrund der Komplexität viraler Polyproteine konnten diese neu generierten Informationen nicht vollständig in offene Biodaten-Ressourcen aufgenommen werden. Die SIB-Wissenschaftler entwickelten daher einen neuen Annotationsstandard für Polyproteine, der die Einbindung von KI-tauglichen Spaltdaten in die SIB-Ressource „ViralZone“ ermöglicht. Diese kuratierten offenen Daten werden die Forschung an Viren mit Bedeutung für die öffentliche Gesundheit beschleunigen. Sie bilden zudem einen zuverlässigen Trainingsdatensatz, von dem KI-Modelle lernen können, um Spaltstellen in weiteren Viren vorherzusagen.

Das Team plant zudem, mit anderen pathogen-spezifischen und allgemeinen offenen Biodaten-Ressourcen wie UniProt und NCBI RefSeq zusammenzuarbeiten, um diese Informationen in ähnlicher Weise einzubinden.

Erfahren Sie mehr über ViralZone

Daten und Fachwissen des SIB als Grundlage für vertrauenswürdige KI in den Lebenswissenschaften

Über die Charakterisierung viraler Proteine in dieser Arbeit hinaus trägt das SIB durch die Bereitstellung hochwertiger Daten und Fachkompetenz in der Bioinformatik zu zuverlässigen KI-Systemen in einer Vielzahl von Anwendungsbereichen im Gesundheitswesen und im Bereich der Biodiversität bei – von der Identifizierung von Krebsmechanismen über die Steuerung von Patientenbehandlungen bis hin zur Unterstützung von Maßnahmen zum Umweltschutz.

Erfahren Sie mehr über die Beiträge des SIB zu vertrauenswürdiger KI

Reference(s)

Bild: Proteinstruktur zweier interagierender Proteine, die aus dem Polyprotein des Ross-River-Virus stammen. Quelle: AlphaFold-Datenbank