Podrobno

Razvoj računskega cevovoda za obsežno analizo rezultatov masne spektrometrije z namenom odkrivanja novih proteinov
ID Skrt, Polona (Avtor), ID Župunski, Vera (Mentor) Več o mentorju... Povezava se odpre v novem oknu, ID Curk, Tomaž (Komentor)

.pdfPDF - Predstavitvena datoteka, prenos (3,87 MB)
MD5: 776A176DDD05F88317335094C19F523A

Izvleček
Mikroproteini predstavljajo relativno novo področje molekularne biologije in genomike, saj je s tehnološkim napredkom analitskih in računskih metod postalo jasno, da je kodirni potencial genoma bistveno večji od predvidenega. V preteklosti je namreč zaradi tehničnih omejitev veljalo prepričanje, da se funkcionalni proteini izražajo iz odprtih bralnih okvirjev (ORF) dolgih vsaj 300 kodonov. To prepričanje pa je privedlo do izključitve kratkih proteinov iz analiz in končnih anotacij. Mikroproteini so danes opredeljeni kot proteini krajši od približno 100 aminokislinskih ostankov, ki nastajajo neposredno s translacijo kratkih ORF-ov. Imajo pomembne regulatorne, signalne in strukturne funkcije, najdemo pa jih pri vseh skupinah organizmov. Odkrivanje mikroproteinov danes temelji na integraciji rezultatov genomskih, translatomskih in proteomskih študij z uporabo najnaprednejših bioinformacijskih metod. Tekom magistrske naloge smo vzpostavili bioinformatski cevovod za obdelavo rezultatov masne spektrometrije, pridobljenih s pristopoma DDA in DIA, pri čemer smo uporabili programa MetaMorpheus in DIA-NN. Kot vhodne podatke smo uporabili 86 proteomskih eksperimentov kvasovke iz podatkovne baze PRIDE ter referenčni proteom in genom kvasovke S. cerevisiae. Za uporabo v cevovodu smo pripravili maksimalno teoretično proteomsko knjižnico, za vrednotenje končnih rezultatov iskanja novih proteinov pa smo razvili postopek iterativnega določanja Paretovih optimalnih front, s katerim smo kategorizirali proteinske zadetke in določili kriterije za ločevanje med verodostojnimi identifikacijami in lažno pozitivnimi zadetki. S pomočjo primerjave zaporedij z orodjem BLAST smo iz končnega nabora potrdili vsaj tri proteinske kandidate, za katere obstajajo dodatni dokazi o izražanju v celici kvasovke. Dva izmed najbolje ocenjenih kandidatov pa sta bila tekom priprave naloge neodvisno potrjena tudi v sorodni raziskavi in vključena v najnovejšo različico referenčnega proteoma kvasovke. V magistrski nalogi smo pokazali uspešnost postavljenega cevovoda, ki omogoča učinkovito procesiranje, filtriranje in analizo velike količine podatkov masne spektrometrije in identifikacijo kandidatnih novih proteinov. Hkrati pa magistrska naloga izpostavlja potencial obsežnega procesiranja proteomskih podatkov kot alternative »multi-omskim« pristopom pri raziskovanju mikroproteinov.

Jezik:Slovenski jezik
Ključne besede:mikroproteini, cevovod, masna spektrometrija
Vrsta gradiva:Magistrsko delo/naloga
Organizacija:FKKT - Fakulteta za kemijo in kemijsko tehnologijo
Leto izida:2026
PID:20.500.12556/RUL-188943 Povezava se odpre v novem oknu
Datum objave v RUL:30.09.2026
Število ogledov:9
Število prenosov:3
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Development of a computational pipeline for large-scale analysis of mass spectrometry data for the discovery of novel proteins
Izvleček:
Microproteins represent a relatively new and rapidly emerging field in molecular biology and genomics. Advances in analytical and computational technologies have revealed that the protein-coding potential of genomes is substantially greater than previously anticipated. Historically, technical limitations led to the assumption that functional proteins were encoded by open reading frames (ORFs) of at least 300 codons, resulting in the systematic exclusion of short proteins from genomic analyses and annotation. Microproteins are now generally defined as proteins shorter than approximately 100 amino acid residues that are produced through the translation of short ORFs. Despite their small size, microproteins perform important regulatory, signalling, and structural functions and have been identified across all major groups of organisms. Their discovery currently relies on the integration of genomic, translatomic and proteomic approaches supported by advanced bioinformatic methods. In this master's thesis, we developed a computational pipeline for the processing and analysis of mass spectrometry data acquired using data-dependent acquisition (DDA) and data-independent acquisition (DIA) approaches, employing specialized software MetaMorpheus and DIA-NN. The pipeline was applied to 86 yeast proteomic experiments obtained from the PRIDE database, together with the reference proteome and genome of Saccharomyces cerevisiae. A maximal theoretical proteome library was constructed as an input for the pipeline. To evaluate the resulting proteins, we developed an iterative approach for determining Pareto-optimal fronts, enabling the classification of protein identifications and the definition of criteria for distinguishing credible identifications from false-positive hits. Sequence comparison using BLAST provided additional evidence supporting at least three protein candidates identified from the final candidate set. Two of the highest-ranked candidates were independently confirmed in a related study during the preparation of this thesis and were subsequently incorporated into the latest version of the yeast reference proteome. The results demonstrate the effectiveness of the developed pipeline for the efficient processing, filtering, and analysis of large-scale mass spectrometry datasets and for the identification of candidate novel proteins. Furthermore, this study highlights the potential of large-scale proteomic data analysis as an alternative to multi-omics approaches for the discovery and characterisation of microproteins.

Ključne besede:microproteins, pipeline, mass spectrometry

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj