joi, 19 mai 2022

Medicina de Precizie și Învățarea Automată (Machine Learning)

Conceptul de ”medicină personalizată” face referire la o abordare  precisă, prescriptivă și preventivă a serviciilor de asistență medicală.  Medicina personalizată are potențialul de a îmbunătăți practica tradițională a medicinei, ajutând la implementarea unui diagnostic precoce și a unui tratament specific și personalizat. Accesul la terapiile genice, prezicerea susceptibilității individuale de boală, diagnostic și tratament al bolilor mentale, terapia medicamentoasă adecvată, țintirea precisă a mecanismelor moleculare oncogenetice reprezintă doar câteva din promisiunile medicinei de precizie. 1

Combustibilul principal al medicinei de precizie este reprezentat de către datele medicale. În ultima perioadă, disponibilitatea crescută a tehnologiilor de genetică și biologie moelculară, a generat un număr tot mai mare de date, acestea provenind din domenii precum genomica, transciptomica, epigenomica, proteomica si metabolomica. În această eră a multi-omicii, metodele de machine learning(ML) și inteligență artificială(AI) au intrat în lumina reflectoarelor, ajutând la obținerea unor noi perspective a acestor date și a unor aplicații medicale revoluționare; au început să se dezvolte strategii de intregare a datelor multi-omicii, punându-se accent în special pe aplicațiile ML.2

În ultimii ani a avut loc o creștere marcată a publicațiilor bazate pe analize de ML, astfel că este nevoie de dezvoltarea unor standarde pentru raportarea acestora, care să permită o evaluare critică și să ajute la realizarea unor algoritmi ce duc la rezultate și predicții corecte. În acest scop, în iulie 2021 a fost publicat un articol care sumarizează recomandările propuse de către ELIXIR Machine Learning Focus Group. Aceste recomandări acoperă patru aspecte majore cuprinse în acronimul DOME (Data, Optimizare, Model, Evaluare). 3

În ceea ce privește setul de date, una dintre recomandări face referire la divizarea acestuia întru-un set de antrenare și un set de testare, utilizând tehnici de bootstrapping sau cross-validation. Cu toate acestea, în biologie deseori apar dificultăți  de suprapunere a seturilor de antrenare/testare, astfel că fiecare ramură a biologiei are propriile recomandări pentru gestionarea acestora. De asemenea, o altă recomandare face referire la raportarea statisticilor privind dimensiunea setului de date, precum și distribuția datelor. Nu în ultimul rând, un aspect important îl reprezintă accesibilitatea datelor. Optimizarea sau antrenarea face referire la procesul de schimbare a valorilor modelului, într-un mod care maximizează capacitatea acestuia de a rezolva o anumită problemă; o optimizare incorectă va duce la un model sub- sau supranatrenat. 3

Într-o altă ordine de idei, evaluarea modelelor de ML se poate realiza fie prin validare experimentală, fie evaluând performanța modelului utilizând anumiți metrici/măsuri de performanță. Întrucât disponibilitatea măsurilor de performanță a modelelor de ML este foarte mare, s-au format anumite comunități de evaluare critică-de exemplu, CAFA-Critical Assessment of Protein Function Annotation sau CAGI- Critical Assessment of Genome Interpretation. După stabilirea măsurilor de performanță, trebuie să se facă o comparare a modelelor din același domeniu, utilizând teste statistice și intervale de încredere.3

            În concluzie, abordarea științifică actuală presupune analiza genomului individual pentru a asigura o asistență medicală preventivă și precisă. Cu scopul de a implementa medicina de precizie, tehnicile de inteligență artificială și învățare automată au un mare potențial de a realiza acest lucru, ajutând la înțelegerea corelațiilor genotip-fenotip, prezicerea susceptibilității individuale de boală, prezicerea răspunsului la diverse terapii, integrarea datelor multi-omicii, s.a. Însă, pentru a crește calitatea, reproductibilitatea și performanța modelelor de învățare automată este necesară stabilirea și respectarea unor ghiduri standardizate, recomandările DOME fiind un prim pas în realizarea acestui obiectiv. 

BIBLIOGARFIE 

1.      Chandra Thapa, Seyit Camtepe. Precision health data: Requirements, challenges and existing techniques for data security and privacy. Computers in Biology and Medicine,Volume 129, 2021, 104130,ISSN 0010-4825. doi.org/10.1016/j.compbiomed.2020.104130

2.      Picard M, Scott-Boyer MP, Bodein A, Périn O, Droit A. Integration strategies of multi-omics data for machine learning analysis. Comput Struct Biotechnol J. 2021 Jun 22;19:3735-3746. doi: 10.1016/j.csbj.2021.06.030

3.      Walsh I, Fishman D, Garcia-Gasulla D, Titma T, Pollastri G; ELIXIR Machine Learning Focus Group, Harrow J, Psomopoulos FE, Tosatto SCE. DOME: recommendations for supervised machine learning validation in biology. Nat Methods. 2021 Oct;18(10):1122-1127. doi: 10.1038/s41592-021-01205-4.






luni, 2 mai 2022

Modelarea multiscalară a dezvoltării organismelor

Organismele multicelulare sunt compuse din diferite tipuri de celule, organizate în țesuturi, care îndeplinesc o funcție fiziologică specifică. [1] [2] Aceste celule specializate sunt foste celule stem, care, trecând prin procesul de diferențiere celulară – schimbându-și forma, mărimea, potențialul de membrană, activitatea metabolică și receptivitatea la semnale – ajung să îndeplinească un rol specific în organism. [3]

Diferențierea celulelor stem în diferite tipuri de țesuturi [3]

Datorită multitudinii de factori care pot influența ciclul de viață al celulelor și, astfel, dezvoltarea organismelor, modelarea multiscalară joacă un rol important în înțelegerea modului de dezvoltare al organismelor. Modelele multiscalare pot simula sisteme biologice complexe - integrând domeniul temporal, spațial și funcțional – și oferă acces la comportamente ale sistemului care nu sunt accesibile folosind tehnici la o singură scară. Iar, pentru captarea eficientă a informațiilor la scară biologică este optim să se utilizeze o combinație de tehnici computaționale. Aceste modele permit generarea și testarea ipotezelor, cuantificarea valorilor care nu pot fi măsurate și transpunerea în sisteme in vivo. Totuși, deoarece multe dintre valorile parametrilor necesare pentru dezvoltarea modelelor multiscalare sunt dificil sau imposibil de măsurat, selectarea adecvată a acestora ramane o preocupare în comunitatea de modelare computațională. Așadar, exploatarea tehnicilor de estimare a parametrilor poate fi necesară pentru o parametrizare mai bună a modelelor multiscalare . [4]

Unul dintre modurile în care poate fi observat modul dezvoltării unui organism, folosind modelarea multiscalară , este folosind Morpheus. Acesta este un environment user-friendly care se poate utiliza pentru modelarea, simularea și integrarea modelelor bazate pe celule, a sistemelor de reacție-difuzie și a ecuațiilor diferențiale ordinare și suportă construcția de modele multiscalare folosind terminologia biologică și construcții matematice.[5] Punctul forte al acestui environment este ca permite crearea de modele multiscalare în mod concis și simularea acestora într-un mod eficient. De asemenea, permite modelarea separată a acestor sisteme, ca modele la o singura scară și combinarea acestora ulterior, în mod flexibil, la mai multe scări, acest fapt permițând începerea de la un anumit nivel de abstractizare și deplasarea în sus și în jos prin includerea unor procese cruciale la diferite scări. [6]

 

Model multiscalar complet. Sistemul intracelular reprezentat prin ecuații diferențiale ordinare reglează diviziunea celulară. Concentrația locală a citokinei difuzive produse de celule modulează ciclul celular intracelular. [6]


Referințe


[1] „Cell differentiation,” Available: https://www.britannica.com/science/cell-biology/Cell-differentiation.

[2] Nature, „Cell Differentiation and Tissue,” Available: https://www.nature.com/scitable/topicpage/cell-differentiation-and-tissue-14046412/.

[3] „Cellular differentiation,” Available: https://en.wikipedia.org/wiki/Cellular_differentiation.

[4] P. J. P. S. Walpole J, „Multiscale computational models of complex biological system,” Annu Rev Biomed Eng, 2013.

[5] W. d. B. L. B. a. A. D. J. Starruß, „Morpheus: a user-friendly modeling environment for multiscale and multicellular systems biology,” Bioinformatics, vol. 30, pp. 1331-1332, 2014.

[6] „Morpheus,” Available: https://morpheus.gitlab.io/courses/multiscale-models/example/.


 

duminică, 10 aprilie 2022

Adnotarea proteinelor folosind Deep Learning

Universul proteic este ansamblul tuturor proteinelor tuturor organismelor. Proteinele sunt molecule esențiale care se găsesc în toate ființele vii. Ele joacă un rol central în structura și funcția corpului nostru. Fiecare proteină este un lanț de blocuri de aminoacizi și, așa cum o imagine poate include mai multe obiecte, o proteină poate avea, de asemenea, mai multe componente, care sunt numite domenii proteice.


În ciuda a 6 decenii de progres, tehnicile de ultimă generație bazate pe aliniere nu pot prezice funcția pentru o treime din secvențele de proteine ​​microbiene, împiedicând capacitatea noastră de a exploata datele de la diverse organisme. Aceste cazuri au dus la antrenarea unor modele de deep learning folosite la prezicerea adnotărilor funcționale pentru secvențe de aminoacizi nealiniate. Pentru antrenare au fost folosite cele 17.929 de familii proteice din baza de date Pfam.



Folosind secvențele de semințe Pfam, a fost stabilită o evaluare riguroasă de referință și găsit un model convoluțional dilatat care reduce eroarea BLASTp și pHMM-urilor cu un factor de nouă. Folosind 80% din întreaga bază de date Pfam, a fost antrenat un predictor al familiei de proteine ​​care este mai precis și de peste 200 de ori mai rapid decât BLASTp.


Prezicerea funcției unei proteine ​​din secvența sa brută de aminoacizi este un pas critic pentru înțelegerea relației dintre genotip și fenotip. Pe măsură ce costul secvențierii ADN-ului scade și proiectele de secvențiere metagenomică cresc în prioritate, instrumentele rapide și eficiente pentru adnotările funcționale vor juca un rol central în exploatarea datelor.


Identificarea proteinelor care catalizează reacții noi, leagă ținte microbiene specifice sau lucrează împreună pentru a construi noi molecule va accelera progresele în biotehnologie.


Concluzia este că modelele de deep learning sunt mai rapide la adnotarea secvențelor de testare reținute decât abordările de profil HMM și BLASTp de ultimă generație, reduc rata de eroare de aproape zece ori și ating o precizie predictivă de 99,84%.

miercuri, 30 martie 2022

Datele genomice ca resursă naturală

În ultimii ani a avut loc o tendință de centralizare internațională a datelor genomice, principalii actori gloabali (Marea Britanie, Statele Unite și Japonia) unindu-și eforturile în crearea și sincronziarea diverselor baze de date genomice.

Cu toate acestea, la sfârșitul lunii martie 2022, guvernul Chinei[1] a proclamat datele genetice drept o resursă naturală strategică, având în vedere totodată consolidarea controlului statului asupra diverselor unități de stocare a informațiilor genetice. Motivul invocat de autoritățile chineze are la bază protejarea informațiilor genetice ale locuitorilor Chinei de entități din afara statului. Primele măsuri întreprinse în acest sens au în vedere interzicerea transmiterii informațiilor genetice de către oameni de știintă chinezi în afara țării, precum și catalogarea bazelor de date genetice umane, inclusiv ale celor deținute de instituții academice, odată la fiecare 5 ani. Se are astfel în vedere accesul si controlul total al guvernului chinez asupra datelor genomice ale locuitorilor Chinei, afectând astfel în mod direct munca oamenilor de știință chinezi care nu vor mai putea garanta neimplicarea autorităților în cazul unor colaborări externe.

Aceste măsuri vin în urma unei politici agresive întreprinse de guvernul chinez în ultimii ani de colectare a datelor genetice ale locuitorilor de pe tot teritoriul Chinei în încercarea de a crea o hartă genetică a întregii populații masculine. Inițiativa a fost catalogată de New York Times drept o ,,escaladare majoră a eforturilor Chinei de a utiliza genetica în încecarea de a-și controla oamenii” întrucât aceste colectări de date genetice au avut loc în unele regiuni împotriva voinței populației etnice minoritare.

 

miercuri, 16 martie 2022

Aplicabilitatea algoritmului genetic în lumea reală

 

Algoritmul genetic reprezintă un tip de algoritm de optimizare. Este folosit pentru a găsi soluția optimă la o anumită problemă de calcul, și utilizează o funcție specială. Algoritmul imită procesele biologice de reproducere și selecție naturală pentru soluțiile cele mai potrivite. [1] Acest algoritm este mult mai eficient decât algoritmul de căutare aleatorie și cel de căutare cu forță brută. [2]

Deoarece algoritmii genetici sunt concepuți pentru a simula un proces biologic, o mare parte din terminologie este împrumutată din biologie. Componentele de bază pentru aproape toți algoritmii genetici sunt:

 

1)     o populație de cromozomi

2)     o funcție de fitness pentru optimizare

3)     selectarea cromozomilor care se vor reproduce

4)     încrucișarea pentru a produce următoarea generație de cromozomi

5)     mutația aleatorie a cromozomilor în noua generație.

 

Algoritmul genetic este utilizat în diferite aplicații și domenii, cum ar fi programarea automată, modelarea economică, sistemul imunitar uman, și altele.

Un grup de kazaci a propus ideea de translație a textului scris de mână, dintr-un set de date mare, în format electronic. Motivul principal pentru care aceștia au creat o astfel de aplicație constă în aceea că taxele, chestionarele, răspunsurile la examene sau alte documente sunt scrise de mână. Pentru a descifra mai ușor cele scrise, se face o conversie din textul scris de mână în contextul digital. [3] Kazacii au propus un algoritm genetic pentru segmentarea liniilor din fișierul text și a cuvintelor din propoziții pe baza enumerării aleatoare a unui parametru.

Și la problema vânzătorului călător se aplică algoritmul genetic. La această problemă se presupune că există un vânzător călător care trebuie să viziteze n orașe urmând cel mai scurt traseu posibil. Se vizitează fiecare oraș exact o dată, apoi se revine la orașul inițial parcurgându-se o altă rută sau aceeași rută. Astfel, cromozomii pentru algoritmul genetic vor fi diferitele permutări ale numerelor întregi de la 1 la n. Se implementează, ulterior, o funcție de potrivire a orașului (se privesc distanțele dintre orașe) pentru a găsi calea cea mai scurtă de la orașul oi la orașul oj.

Algoritmul genetic se mai folosește și pentru repararea sateliților GEO conform misiunii programate. [4] Fiecare navă spațială de întreținere trebuie să se apropie de sateliții țintă pentru a efectua misiuni de reparare cu combustibil limitat. Trebuie comunicată secvența optimă de întreținere a navei și ora de întâlnire a fiecărei nave spațiale la un anumit punct, pentru a minimiza costul total de combustibil al tuturor navelor spațiale, obținând, totuși, repararea tuturor sateliților țintă.

Algoritmii genetici sunt utilizați de companii pentru a optimiza programele și proiectează produse care variază de la sateliți și probleme astronautico-științifice până la mici cipuri de calculator și chiar conținutul medicamentelor.

Spre exemplu, laboratorul Național Los Alamos a folosit algoritmul pentru a analiza datele de la sateliți și pentru a crea efecte realiste pentru filmele precum The Lord of the Rings sau Troy. [5] Cu siguranță, algoritmul nu este ușor de implementat și necesită cunoștințe aprofundate din domeniul informaticii și al geneticii, și din domeniul în care se săvârșește proiectul sau operațiunea.

 


Bibliografie


[1] Goldberg, D. E., & Holland, J. H. (1988). Genetic algorithms and machine learning.

[2] Kinnear, K. E., Langdon, W. B., Spector, L., Angeline, P. J., & O'Reilly, U. M. (Eds.). (1994). Advances in genetic programming (Vol. 3). MIT press.

[3] Toiganbayeva, N., Kasem, M., Abdimanap, G., Bostanbekov, K., Abdallah, A., Alimova, A., & Nurseitov, D. (2021). KOHTD: Kazakh Offline Handwritten Text Dataset. 

[4] Han, P., Guo, Y., Li, C., Zhi, H., & Lv, Y. (2021). GEO satellites. 

[5] Mitchell, M. (2009). Complexity: A guided tour. Oxford University Press. 



Bioinformatica și genetica criminalistică

                                                                                                                                      Zoltan...