Hopp til innhold

CORAL-AI V.01 · Referansetest for molekylær prioritering · oktober 2025

Kombinasjon av 3D-struktur og sekvens oppnådde EF₁%=38,2 i molekylær screening

CORAL-AI V.01 kombinerte struktur- og sekvensrepresentasjoner for å rangere protein–ligand-interaksjoner. I referansetesten oppnådde modellen EF₁%=38,2 og AUC-ROC=0,823; metodene den ble sammenlignet med oppnådde EF₁%-verdier mellom 15,5 og 33,3.

Referansetest for prioritering av protein–ligand

Modalitet
Virtuell screening av protein–ligand-interaksjoner
Data
Komplekser og lokkestoffer fra DUD-E-referansetesten
Inndata
3D-molekylstruktur og proteinsekvens
Primærmåling
EF₁% · anrikning innenfor den høyest rangerte prosenten
Sammenligningsmetoder
OnionNet-SFCT, GNINA og GenScore
Hovedresultat
CORAL-AI V.01 · EF₁%=38,2
Supplerende måling
AUC-ROC=0,823
Omfang
Beregningsbasert referansetest; ingen prospektiv eksperimentell validering

Verdien av screening ligger i å avgjøre hva som skal testes først

Molekylbiblioteker kan inneholde millioner av forbindelser, mens den eksperimentelle kapasiteten er begrenset. Virtuell screening snevrer inn dette rommet ved å rangere kandidater før de når laboratoriet. Verdien avhenger mindre av å klassifisere hele biblioteket korrekt enn av å konsentrere aktive forbindelser øverst på listen.

I akvakultur, der oppdagelsesprogrammer ofte har mindre infrastruktur og færre data enn humanfarmasøytiske programmer, kan en bedre første rangering redusere lite informative forsøk og rette ressursene mot kandidater med sterkere beregningsmessig støtte.

Å kombinere utfyllende signaler ved sterk klasseubalanse

Protein–ligand-affinitet avhenger av geometri, kjemisk miljø og reseptorkontekst. En modell som bare bruker 3D-struktur kan gå glipp av evolusjonær informasjon i proteinet; en modell som bare bruker sekvens ser ikke den romlige plasseringen av atomene direkte. De evaluerte dataene inneholdt dessuten omtrent 1,6 % positive tilfeller, slik at høy samlet nøyaktighet kunne skjule svak rangering av de få aktive forbindelsene.

Målet var å forbedre tidlig gjenfinning uten å tolke en godt rangert prediksjon som terapeutisk aktivitet. EF₁% ble derfor valgt som primærmåling, mens AUC-ROC ble beholdt som en supplerende måling av global ytelse.

En hybridarkitektur for struktur, sekvens og usikkerhet

CORAL-AI V.01 representerte molekylkomplekser med grafnevrale nettverk og satte hver reseptor i kontekst med en proteinspråkmodell. Et kryssoppmerksomhetslag integrerte begge kildene før en interaksjonsscore ble produsert. Klassebalansert utvalg hindret lokkestoffer i å dominere treningen.

Arkitekturen omfattet estimering av usikkerhet med ensembler og Monte Carlo-dropout. Denne informasjonen erstatter ikke hovedprediksjonen, men kan skille kandidater med lignende score og ulik sikkerhet før forbindelser velges til senere eksperimentelt arbeid.

Flere aktive forbindelser konsentrert i den høyest rangerte prosenten

EF₁%=38,2Anrikningsfaktor oppnådd av CORAL-AI V.01 i den evaluerte referansetesten.

CORAL-AI V.01 oppnådde EF₁%=38,2. GenScore nådde 33,3; GNINA 18,8; og OnionNet-SFCT 15,5. Den relative forskjellen var 14,7 % mot nærmeste sammenligningsmetode og 146,5 % mot den laveste verdien i gjennomgangen.

Modellen oppnådde også AUC-ROC=0,823. Målingene besvarer ulike spørsmål: AUC-ROC oppsummerer separasjonen i hele datasettet, mens EF₁% måler konsentrasjonen av aktive forbindelser der eksperimentell utvelgelse vanligvis starter.

MetodeEF₁%Forskjell mot CORAL-AI V.01
CORAL-AI V.0138,2Referanse
GenScore33,3CORAL-AI V.01 +14,7 %
GNINA18,8CORAL-AI V.01 +103,2 %
OnionNet-SFCT15,5CORAL-AI V.01 +146,5 %

Resultatene sammenligner prioriteringsytelse i denne referansetesten. De måler ikke eksperimentell affinitet, terapeutisk effekt eller universell ytelse på tvers av vilkårlige biblioteker.

Sammenlignende referansetest

Anrikningsfaktor i den øverste prosenten

EF₁%
OnionNet-SFCT
15.5
GNINA
18.8
GenScore
33.3
CORAL-AI V.01
38.2
EF₁% viser hvor sterkt aktive forbindelser konsentreres i den høyest rangerte prosenten sammenlignet med tilfeldig utvalg. En høyere verdi betyr mer effektiv prioritering, ikke målt biologisk effekt.

En mer konsentrert rangering reduserer den eksperimentelle fronten

I denne evalueringen hentet kombinasjonen av struktur og sekvens frem en større andel aktive forbindelser nær toppen av rangeringen. For et oppdagelsesprogram betyr det at en mindre del av biblioteket kan gå videre til fysiske analyser før relevante signaler blir funnet.

Resultatet validerer arkitekturens prioriteringsevne i den undersøkte referansetesten. Det viser ikke effekt i dyr og erstatter ikke eksperimentell bekreftelse. Bruk i akvakultur krever prospektiv evaluering av hvert mål, kjemiske domene og bibliotek etter en protokoll med definerte kontroller.

Evalueringens omfang

Gjennomgangen brukte DUD-E som sett med aktive komplekser og lokkestoffer og sammenlignet EF₁% med OnionNet-SFCT, GNINA og GenScore. CORAL-AI V.01 integrerte molekylgrafer, sekvensrepresentasjoner, kryssoppmerksomhet, klassebalansering og estimering av usikkerhet. EF₁% målte tidlig gjenfinning og AUC-ROC global diskriminering. Prospektive forsøk, in vivo-validering, kampanjekostnader og regulatoriske resultater var ikke inkludert.

Referanser: Mysinger et al., Journal of Medicinal Chemistry 55, 6582–6594 (2012); Kim et al., Chemical Science 14, 3245–3258 (2023); Lin et al., Science 379, 1123–1130 (2023).

Har du et molekylbibliotek som må prioriteres?

Definer målet, det kjemiske domenet og valideringsprotokollen før en screeningkampanje startes.

Vi hører gjerne fra deg!

Utvid forskningsmulighetene dine i dag. La oss komme i gang!