CORAL-AI V.01 · Referansetest for molekylær prioritering · oktober 2025
Kombinasjon av 3D-struktur og sekvens oppnådde EF₁%=38,2 i molekylær screening
CORAL-AI V.01 kombinerte struktur- og sekvensrepresentasjoner for å rangere protein–ligand-interaksjoner. I referansetesten oppnådde modellen EF₁%=38,2 og AUC-ROC=0,823; metodene den ble sammenlignet med oppnådde EF₁%-verdier mellom 15,5 og 33,3.
Kortfakta
Referansetest for prioritering av protein–ligand
- Modalitet
- Virtuell screening av protein–ligand-interaksjoner
- Data
- Komplekser og lokkestoffer fra DUD-E-referansetesten
- Inndata
- 3D-molekylstruktur og proteinsekvens
- Primærmåling
- EF₁% · anrikning innenfor den høyest rangerte prosenten
- Sammenligningsmetoder
- OnionNet-SFCT, GNINA og GenScore
- Hovedresultat
- CORAL-AI V.01 · EF₁%=38,2
- Supplerende måling
- AUC-ROC=0,823
- Omfang
- Beregningsbasert referansetest; ingen prospektiv eksperimentell validering
01 · Kontekst
Verdien av screening ligger i å avgjøre hva som skal testes først
Molekylbiblioteker kan inneholde millioner av forbindelser, mens den eksperimentelle kapasiteten er begrenset. Virtuell screening snevrer inn dette rommet ved å rangere kandidater før de når laboratoriet. Verdien avhenger mindre av å klassifisere hele biblioteket korrekt enn av å konsentrere aktive forbindelser øverst på listen.
I akvakultur, der oppdagelsesprogrammer ofte har mindre infrastruktur og færre data enn humanfarmasøytiske programmer, kan en bedre første rangering redusere lite informative forsøk og rette ressursene mot kandidater med sterkere beregningsmessig støtte.
02 · Utfordring
Å kombinere utfyllende signaler ved sterk klasseubalanse
Protein–ligand-affinitet avhenger av geometri, kjemisk miljø og reseptorkontekst. En modell som bare bruker 3D-struktur kan gå glipp av evolusjonær informasjon i proteinet; en modell som bare bruker sekvens ser ikke den romlige plasseringen av atomene direkte. De evaluerte dataene inneholdt dessuten omtrent 1,6 % positive tilfeller, slik at høy samlet nøyaktighet kunne skjule svak rangering av de få aktive forbindelsene.
Målet var å forbedre tidlig gjenfinning uten å tolke en godt rangert prediksjon som terapeutisk aktivitet. EF₁% ble derfor valgt som primærmåling, mens AUC-ROC ble beholdt som en supplerende måling av global ytelse.
03 · Tilnærming
En hybridarkitektur for struktur, sekvens og usikkerhet
CORAL-AI V.01 representerte molekylkomplekser med grafnevrale nettverk og satte hver reseptor i kontekst med en proteinspråkmodell. Et kryssoppmerksomhetslag integrerte begge kildene før en interaksjonsscore ble produsert. Klassebalansert utvalg hindret lokkestoffer i å dominere treningen.
Arkitekturen omfattet estimering av usikkerhet med ensembler og Monte Carlo-dropout. Denne informasjonen erstatter ikke hovedprediksjonen, men kan skille kandidater med lignende score og ulik sikkerhet før forbindelser velges til senere eksperimentelt arbeid.
04 · Resultater
Flere aktive forbindelser konsentrert i den høyest rangerte prosenten
CORAL-AI V.01 oppnådde EF₁%=38,2. GenScore nådde 33,3; GNINA 18,8; og OnionNet-SFCT 15,5. Den relative forskjellen var 14,7 % mot nærmeste sammenligningsmetode og 146,5 % mot den laveste verdien i gjennomgangen.
Modellen oppnådde også AUC-ROC=0,823. Målingene besvarer ulike spørsmål: AUC-ROC oppsummerer separasjonen i hele datasettet, mens EF₁% måler konsentrasjonen av aktive forbindelser der eksperimentell utvelgelse vanligvis starter.
| Metode | EF₁% | Forskjell mot CORAL-AI V.01 |
|---|---|---|
| CORAL-AI V.01 | 38,2 | Referanse |
| GenScore | 33,3 | CORAL-AI V.01 +14,7 % |
| GNINA | 18,8 | CORAL-AI V.01 +103,2 % |
| OnionNet-SFCT | 15,5 | CORAL-AI V.01 +146,5 % |
Resultatene sammenligner prioriteringsytelse i denne referansetesten. De måler ikke eksperimentell affinitet, terapeutisk effekt eller universell ytelse på tvers av vilkårlige biblioteker.
Sammenlignende referansetest
Anrikningsfaktor i den øverste prosenten
05 · Hva det betyr
En mer konsentrert rangering reduserer den eksperimentelle fronten
I denne evalueringen hentet kombinasjonen av struktur og sekvens frem en større andel aktive forbindelser nær toppen av rangeringen. For et oppdagelsesprogram betyr det at en mindre del av biblioteket kan gå videre til fysiske analyser før relevante signaler blir funnet.
Resultatet validerer arkitekturens prioriteringsevne i den undersøkte referansetesten. Det viser ikke effekt i dyr og erstatter ikke eksperimentell bekreftelse. Bruk i akvakultur krever prospektiv evaluering av hvert mål, kjemiske domene og bibliotek etter en protokoll med definerte kontroller.
06 · Metodisk merknad
Evalueringens omfang
Gjennomgangen brukte DUD-E som sett med aktive komplekser og lokkestoffer og sammenlignet EF₁% med OnionNet-SFCT, GNINA og GenScore. CORAL-AI V.01 integrerte molekylgrafer, sekvensrepresentasjoner, kryssoppmerksomhet, klassebalansering og estimering av usikkerhet. EF₁% målte tidlig gjenfinning og AUC-ROC global diskriminering. Prospektive forsøk, in vivo-validering, kampanjekostnader og regulatoriske resultater var ikke inkludert.
Referanser: Mysinger et al., Journal of Medicinal Chemistry 55, 6582–6594 (2012); Kim et al., Chemical Science 14, 3245–3258 (2023); Lin et al., Science 379, 1123–1130 (2023).
Har du et molekylbibliotek som må prioriteres?
Definer målet, det kjemiske domenet og valideringsprotokollen før en screeningkampanje startes.
