Sekvenssien käsittelyn automatisointi (Stadenin pregap4 ja gap4)

Last modified on 24. heinäkuuta 2026 • 2 min read • 414 words
Kirjoitin jo jonkin aikaa sitten skriptin, jonka tarkoituksena on automatisoida suurin osa työstä, joka liittyy sekvenssien siirtämiseen ABI-sekvensseristämme gap4-tietokantaan.
Kirjoitin jo jonkin aikaa sitten skriptin, joka pyrkii automatisoimaan suurimman osan työstä, joka liittyy sekvenssien siirtämiseen ABI-sekvensseristämme gap4-tietokantaan. Skripti on kaukana täydellisestä ja näyttää tältä:!/bin/sh rm *.seq *.log Log\ file.txt for i in ls .ab1; do echo "Nimeän uudelleen $i" mv $i echo $i | sed “s/ .{27}.\{27\} ./\1.ab1/" done ls *.ab1 *.txt > tracefile.list pregap4 -nowin -config /home/jeltsch/bin/pregap4_gap4.conf -fofn tracefile.list gap4 test.0.auxLaitoin skriptin kansioon ~/bin; ja tämä skripti on tarkoitettu suoritettavaksi siitä hakemistosta, jossa sekvenssit sijaitsevat. Yleensä koneellamme tehdyn yhden sekvensointikierroksen ab1-jäljitystiedostot tallennetaan yhteen hakemistoon yhdessä joidenkin (minulle) merkityksettömien lokitiedostojen jne. kanssa. Ensin skripti poistaa tarpeettomat tiedostot hakemistosta; sitten se lyhentää tiedostonimet 27 merkkiin plus .ab1-päätteeseen. Huvittavaa kyllä, pregap4 käsittelee pidempiä tiedostonimiä hyvin, mutta gap4:llä on ongelmia. Sen jälkeen kaikki jäljellä olevat tiedostot lisätään luetteloon (tracefile.list), jonka pregap4 lukee. pregap4:ää käytetään ei-interaktiivisesti. Se saa ohjeensa (moduulien asetukset) konfiguraatiotiedostosta (joka minun tapauksessani on myös tallennettu hakemistoon ~/bin). pregap4 kutsuu gap4-shotgun-assembleria ja tallentaa lukemat gap4-tietokantaan. Valitettavasti en ole keksinyt, miten tälle tietokannalle voitaisiin automaattisesti antaa kuvaava nimi. Tällä hetkellä niillä on kaikilla sama nimi, ja ne voidaan tunnistaa vain niiden sijainnin perusteella eri hakemistoissa. Olisi hyvä antaa niille automaattisesti yksilöllinen nimi, esimerkiksi kokoonpanon suorituspäivämäärä tai jotain vastaavaa. Kun kaikki tämä on tehty, gap4 kutsutaan ja se lataa juuri luodun tietokannan manuaalista tarkastelua ja muokkausta varten.Suurin osa sekvensoinnistamme tehdään uusien vektoreiden tarkistamiseksi. Siksi tiedämme yleensä tarkalleen, mitä sekvenssiä odotamme. Jos (mikä valitettavasti ei ole tilanne) ihmiset käyttäisivät rakenteidensa dokumentointiin ohjelmaa, joka sisältää täydelliset sekvenssitiedot (kuten Gene Construction Kit), trace-tiedostot tulisi verrata automaattisesti tällaiseen ”odotettuun” sekvenssiin.Tällä hetkellä saan tämän aikaan viemällä DNA-sekvenssin Gene Construction Kit -ohjelmasta (GCK) tekstimuotoisena tiedostona (ilmeisesti voisin käyttää myös EMBL-muotoa) ja sijoittamalla tämän tiedoston yhdessä ab1-trace-tiedoston kanssa samaan hakemistoon ennen skriptin käynnistämistä. Näin se käsitellään aivan kuten mikä tahansa muu sekvenssi, ja sekvenssilukemat kohdistetaan sen mukaan. On kuitenkin useita asioita, jotka haluaisin asetettavan automaattisesti gap4:ää käynnistettäessä, koska suoritan aina saman klikkausjärjestyksen tarkastellessani kohdistusta manuaalisesti gap4:ssä: Kaikkien eteenpäin suuntautuvien lukukehysten näyttäminen: Oletan, että koska ”odotettu sekvenssi” on pisin, se esiintyy kokoonpanossa aina eteenpäin suunnattuna ja lukukehykset ovat aina eteenpäin suunnattuja. Tämä johtuu siitä, että pidän (luettavuuden helpottamiseksi) vektorisekvenssin GCK:ssa aina sellaisessa suunnassa, että GOI:n CDS on eteenpäin suunnatussa kehyksessä.Erojen korostaminen taustavärillä tulisi ottaa käyttöön. Suur- ja pienkirjaineroja ei tulisi käsitellä eroina. Koska sekvensointimme laatu on vaatimaton, oletusarvot ovat useimmiten liian tiukkoja, jotta gap4 voisi syöttää lukemat samaan kontigiin. Siksi päädyn yleensä etsimään sisäisiä toistoja ja syöttämään ne manuaalisesti. Tämän pitäisi olla mahdollista asettaa automaattisesti gap4-kokoonpanossa, mutta en ole vielä ehtinyt selvittää, miten se tehdään.