I ricercatori e gli sviluppatori di farmaci possono ora studiare i virus che presentano i maggiori rischi per la salute pubblica su scala più ampia e con maggiore rapidità. Sono ora disponibili al pubblico modelli che illustrano le interazioni tra le proteine virali per 2.800 virus che infettano l’uomo e i loro parenti, rispetto a una manciata di casi in precedenza, insieme alle prime strutture 3D mai previste per quasi 7.800 proteine virali. Il SIB ha partecipato alla selezione dei virus analizzati dall’IA AlphaFold, ha fornito dati proteici esclusivi per 699 virus e ha effettuato il controllo di qualità delle interazioni previste per queste proteine. Il lavoro è frutto di una collaborazione internazionale che coinvolge EMBL-EBI, NVIDIA, Google DeepMind, l’Università Nazionale di Seul e l’Università di Glasgow. Esso amplia il contributo del SIB al progetto AlphaFold, vincitore del Premio Nobel, e alla lotta contro le malattie infettive.
AlphaFold: un’intelligenza artificiale vincitrice del Premio Nobel realizzata utilizzando le risorse del SIB
AlphaFold ha reso possibile il calcolo rapido della struttura tridimensionale di una proteina a partire dalla sua sequenza aminoacidica, evitando così lunghe e costose procedure sperimentali. I modelli successivi hanno esteso questa capacità alla previsione delle interazioni tra proteine e altre molecole.
Lo sviluppo di AlphaFold – premiato con il Premio Nobel per la Chimica 2024 – si è basato su tre risorse aperte e iniziative sviluppate e co-sviluppate dagli scienziati del SIB. UniProt ha fornito dati di addestramento aperti e di alta qualità, oltre a conoscenze su milioni di proteine, mentre il concorso CASP e la risorsa CAMEO hanno confermato, rispettivamente, l’impressionante accuratezza dell’IA e la sua applicabilità a tutte le proteine umane.
Colmare una lacuna nei dati per garantire la prontezza in caso di epidemia
Lo sviluppo di test diagnostici, vaccini e terapie contro i virus dipende dalla conoscenza della struttura tridimensionale delle proteine virali e delle modalità con cui queste proteine interagiscono tra loro. La velocità senza precedenti con cui sono stati sviluppati i vaccini contro il SARS-CoV-2, ad esempio, è stata possibile solo grazie a decenni di ricerca su virus simili condotta prima della pandemia.
AlphaFold: un’intelligenza artificiale vincitrice del Premio Nobel realizzata utilizzando le risorse del SIB
AlphaFold ha reso possibile il calcolo rapido della struttura tridimensionale di una proteina a partire dalla sua sequenza aminoacidica, evitando così lunghe e costose procedure sperimentali. I modelli successivi hanno esteso questa capacità alla previsione delle interazioni tra proteine e altre molecole.
Lo sviluppo di AlphaFold – premiato con il Premio Nobel per la Chimica 2024 – si è basato su tre risorse aperte e iniziative sviluppate e co-sviluppate dagli scienziati del SIB. UniProt ha fornito dati di addestramento aperti e di alta qualità, oltre a conoscenze su milioni di proteine, mentre il concorso CASP e la risorsa CAMEO hanno confermato, rispettivamente, l’impressionante accuratezza dell’IA e la sua applicabilità a tutte le proteine umane.
Tali conoscenze mancano per l’80% dei virus. Ciò è dovuto ai costi e al tempo necessari per gli studi sperimentali, oltre al fatto che alcuni virus sono impossibili da coltivare in laboratorio.
Il modello di intelligenza artificiale AlphaFold (vedi riquadro) supera questa limitazione prevedendo con precisione le strutture tridimensionali delle proteine a partire dalle sequenze di aminoacidi. Una collaborazione internazionale tra settore pubblico e privato ha ora utilizzato AlphaFold per prevedere le interazioni tra coppie di proteine virali in 2.800 virus, tutti appartenenti a famiglie note per infettare gli esseri umani.
La collaborazione – che coinvolge l’Istituto europeo di bioinformatica del Laboratorio europeo di biologia molecolare (EMBL-EBI), NVIDIA, Google DeepMind, l’Università Nazionale di Seul, l’Università di Glasgow, il SIB, la Coalition for Epidemic Preparedness Innovations (CEPI) e l’Università Sungkyunkwan – ha riunito competenze in materia di biologia virale, biologia strutturale, biocurazione, gestione e analisi dei dati e intelligenza artificiale, oltre alla potenza di calcolo necessaria per effettuare previsioni su questa scala.
I contributi del SIB hanno compreso:
- la selezione congiunta, insieme all’Università di Glasgow,dell’insieme dei virus di riferimento analizzati;
- fornire dati esclusivi sulle poliproteine – complesse proteine precursori prodotte dal 47% dei virus che infettano l’uomo, tra cui Zika, dengue e poliovirus;
- la convalida della plausibilità delle previsioni strutturali di AlphaFold per queste proteine, attingendo alle conoscenze complete e curate sulla biologia virale accumulate nella risorsa ViralZone del SIB.
Ciò ha permesso ad AlphaFold di modellare, per la prima volta, le strutture 3D e le probabili interazioni di quasi 7.800 proteine virali derivate dalle poliproteine (vedi ulteriori dettagli di seguito).
Tutti i dati sono stati resi disponibili oggi in modalità aperta nel database AlphaFold, in concomitanza con una riunione dell’Assemblea Generale delle Nazioni Unite sulla prevenzione, la preparazione e la risposta alle pandemie, tenutasi questa settimana a New York. Le prime analisi indicano già tipi di interazioni tra proteine virali finora sconosciuti, con implicazioni per la ricerca terapeutica e per l’utilizzo delle proteine virali come strumenti biotecnologici.
Questo lavoro rafforza la missione del SIB di ampliare i confini della scienza dei dati attraverso una conoscenza approfondita dei dati biologici, per fornire a ricercatori e medici risorse eccezionali e per generare conoscenze che consentano l’innovazione verso un futuro migliore.
Raccolta di dati di base sui virus rilevanti per la salute umana
I virus sono eccezionalmente diversi tra loro, il che rende difficile il loro studio. Le poliproteine aggiungono ulteriore complessità. Queste lunghe catene di aminoacidi vengono scisse in diverse proteine attive, le cui sequenze precise sono estremamente difficili da determinare. Ciò è dovuto al fatto che virus diversi hanno sviluppato meccanismi completamente diversi per la scissione delle loro poliproteine, il che significa che non esiste un indizio genetico comune che indichi dove avvengano questi tagli.
Gli scienziati del SIB sono stati i primi a mappare tali siti di scissione nelle poliproteine virali. I siti probabili sono stati identificati tramite un processo semi-automatizzato che ha combinato strumenti computazionali, ampie revisioni della letteratura e una profonda competenza in biologia virale. L’accuratezza dei siti previsti è stata poi confermata dalla modellazione strutturale, che ha dimostrato se le proteine scisse risultanti fossero biologicamente plausibili.
Il lavoro, concluso nel maggio di quest’anno, ha fornito i primi dati affidabili sulle sequenze proteiche di 7.783 proteine attive derivate da poliproteine presenti in 699 virus, tutti appartenenti a famiglie note per infettare l’uomo. Il progetto è stato realizzato nell’ambito del Pathogen Data Network, coordinato congiuntamente dal SIB e sostenuto dai National Institutes of Health degli Stati Uniti.
Rendere le nuove conoscenze sui virus liberamente accessibili ai ricercatori e all’intelligenza artificiale
La complessità delle poliproteine virali ha reso impossibile l’inserimento integrale di queste nuove informazioni nelle risorse di dati biologici aperte. Gli scienziati del SIB hanno quindi creato un nuovo standard di annotazione per le poliproteine, consentendo l’integrazione di dati di scissione compatibili con l’intelligenza artificiale nella risorsa ViralZone del SIB. Questi dati aperti e curati accelereranno la ricerca sui virus rilevanti per la salute pubblica. Costituiscono inoltre un affidabile set di dati di addestramento da cui i modelli di intelligenza artificiale potranno imparare per prevedere i siti di scissione in altri virus.
Il team prevede inoltre di collaborare con altre risorse di biodati aperte, sia specifiche per determinati agenti patogeni che di carattere generale, tra cui UniProt e NCBI RefSeq, per integrare in modo analogo queste informazioni.
I dati e le competenze del SIB alla base di un'IA affidabile per le scienze della vita
Oltre alla caratterizzazione delle proteine virali oggetto di questo studio, la fornitura da parte di SIB di dati di alta qualità e competenze nel campo della bioinformatica sta contribuendo alla realizzazione di sistemi di intelligenza artificiale affidabili in una vasta gamma di applicazioni relative alla salute e alla biodiversità: dall’identificazione dei meccanismi del cancro e dall’orientamento dei trattamenti dei pazienti fino alla definizione di azioni a tutela dell’ambiente.
Reference(s)
Immagine: Struttura di due proteine interagenti derivate dalla poliproteina del virus Ross River. Fonte: Database AlphaFold