DNA-koden er kartlagt, men vi forstår fortsatt ikke hva store deler av arvematerialet betyr. Små variasjoner utenfor genene kan få store følger for genaktiviteten. Det nye KI-verktøyet AlphaGenome skal hjelpe forskere med å finne ut hvordan.
Da det menneskelige genomet ble kartlagt, fikk man oversikt over DNA-koden vår. Men på samme måte som at å kunne lese bokstaver ikke er det samme som å forstå betydningen av en tekst, er det å vite rekkefølgen på DNA-koden ikke det samme som å forstå hvilken funksjon alle deler av DNA-koden har.
Å lese mellom linjene
Når vi snakker om DNA, snakker vi også ofte om gener – altså oppskrifter på proteiner. Men mesteparten av DNA-et er ikke gener, og store deler av det vi kaller «ikke-kodende DNA» ble lenge kalt «søppel-DNA». I dag vet vi bedre. Vi vet nå at noe av dette DNA-et har viktige oppgaver, mens funksjonen til andre deler fortsatt er uklar.
Nå har Google DeepMind, selskapet som utviklet proteinfoldingsprogrammet AlphaFold, utviklet et nytt program som skal bidra til å løse arvematerialets gåter.
Det nye KI-verktøyet, AlphaGenome, er utviklet for å predikere hvordan DNAsekvenser, særlig i de ikke-kodende delene av genomet, påvirker genreguleringen.
Fra søppel til funksjon
Når vi snakker om DNA snakker vi ofte om gener – oppskrifter på proteiner. Men bare en liten del av DNA-et vårt, ca. 1,5 prosent, er det som kalles proteinkodende DNA.
Det vi kaller «ikke-kodende DNA» ble lenge kalt «søppel-DNA» (junk DNA), da man ikke visste hvilken funksjon det hadde. Forskning har vist at det i det ikke-kodende DNA-et finnes områder som kontrollerer genaktiviteten. De påvirker hvilke gener som brukes, når de brukes, og hvor mye RNA og til slutt protein, som blir laget. Variasjoner i disse områdene er derfor viktige, selv om de ikke endrer selve oppskriften på proteinet.
Når et gen kopieres til RNA, kan cellen også skjøte sammen delene av arbeidskopien på forskjellige måter, litt som å lage ulike varianter av en rett fra samme oppskrift. Dermed kan ett gen gi opphav til ulike RNA-molekyler og proteinvarianter.
Fra sekvens til funksjon
AlphaGenome er trent opp til å finne sammenhenger mellom DNA-sekvenser og biologisk aktivitet. Der språkmodellene folk flest bruker lærer sammenhenger mellom ord, prøver AlphaGenome å forutsi hvordan en DNA-sekvens henger sammen med aktivitet i cellene. Modellen er trent på DNA fra mennesker og mus og store mengder data fra tidligere vitenskapelig forskning.
Slike data kan vise hvilke gener som er aktive, hvilke områder av DNA-et som er tilgjengelige for cellens maskineri, hvor proteiner som styrer genaktiviteten binder seg, og hvordan RNA skjøtes sammen. Det gjør at AlphaGenome, med utgangspunkt i én DNA-sekvens, kan gi en kvalifisert gjetning på hvordan sekvensen virker.
Én million DNA-baser
Å bruke KI til å analysere DNA er ikke nytt, men tidligere verktøy har begrensninger. Én utfordring er at genregulering kan virke over store avstander. Kontrollområder som påvirker om og hvor mye et gen brukes, kan ligge langt unna genet langs DNA-tråden, men likevel komme nær når DNA-et foldes inne i cellekjernen. Samtidig kan en endring i én enkelt DNA-base være viktig. AlphaGenome analyserer opptil én million DNAbaser i sammenheng. Dermed kan modellen ta hensyn til kontrollområder som ligger langt unna et gen, samtidig som den kan anslå virkningen av en endring i én enkelt base.
I DeepMind-forskernes sammenligninger matchet eller overgikk AlphaGenome de eldre modellene i 25 av 26 tester av hvordan DNA-varianter påvirker genreguleringen.
– Med én modell kan man se på effekten av en variant gjennom ulike linser og undersøke hvordan den påvirker ulike lag av molekylærbiologien. Tidligere måtte man kanskje bruke flere forskjellige modeller til den samme analysen, sier Natasha Latysheva, forsker i AlphaGenome-teamet, i en rundebordsamtale publisert av Google DeepMind.
Små endringer – store følger
Noen sykdommer skyldes mutasjoner inne i gener, men også variasjoner i ikke-kodende DNA kobles til sykdom. Det er nettopp slike sammenhenger AlphaGenome kan hjelpe forskere med å lete etter. Modellen kan brukes til å vurdere hvilke DNA-endringer som påvirker genaktivitet, slik at forskerne kan prioritere hvilke varianter som bør undersøkes videre i laboratoriet. På sikt kan dette være nyttig i forskning på sjeldne sykdommer, der forskere ofte finner «uvanlige » DNA-varianter uten å vite om de har betydning for sykdommen.
Forskerne bak AlphaGenome testet modellen på DNA-varianter nær genet TAL1, som kan føre til kreft om det er regulert feil. En av variantene lå utenfor selve genet, men modellen indikerte at den kunne skape et nytt bindingssted for et protein som øker genaktiviteten. Slik kan en liten DNA-endring utenfor et gen påvirke hvordan genet brukes og bidra til sykdom.
Veiviser, ikke fasit
AlphaGenome er det andre store KI-verktøyet til Google DeepMind. Mens AlphaGenome predikerer hvordan DNA-sekvenser påvirker genaktivitet, predikerer AlphaFold den tredimensjonale formen til proteiner ut fra aminosyresekvensen. AlphaFold revolusjonerte proteinforskningen da det ble presentert ved å gjøre det mulig å predikere proteinstrukturer langt raskere enn før. To av forskerne bak KI-verktøyet, Demis Hassabis og John Jumper, fikk Nobelprisen i kjemi i 2024, sammen med den amerikanske biokjemikeren David Baker. AlphaFold viste hvor stor betydning KI kan få i biologisk forskning, og når DeepMind-gruppen nå lanserer et nytt verktøy rettet mot genomet, er forventningene høye.
Ingen av de nye KI-verktøyene erstatter laboratorieeksperimenter. AlphaGenome anslår mulige virkninger av en DNA-variant, men kan ikke alene avgjøre om et menneske vil utvikle en sykdom eller en bestemt egenskap. Men genom-modellen gir forskere en pekepinn på hvor de kan begynne å lete for å finne mulige årsaker. Genaktiviteten påvirkes også av blant annet celletype, utviklingsstadium, andre deler av genomet og miljøet. I tillegg har modellen fortsatt problemer med kontrollområder som virker over svært store avstander. Likevel kan gode prediksjoner hjelpe forskere med å prioritere. I stedet for å undersøke tusenvis av mulige DNA-varianter like grundig i laboratoriet, kan de begynne med variantene modellen peker ut som mest interessante.
– Forhåpentligvis kan forskere bruke AlphaGenome til å få mest mulig ut av de begrensede ressursene og forskningsmidlene de har, sier Jun Cheng, forsker i AlphaGenome-teamet.