| Tantárgy neve: | Systems Bioinformatics P-ITBIO-0048 |
| Tárgyfelelős: | Ligeti Balázs |
| Tantárgy oktatója: | Ligeti Balázs |
| A tantárgy céljának rövid ismertetése: | A kurzus célja a nagy adatmennyiségekkel foglalkozó bioinformatika rendszerbiológiai megközelítésű bemutatása. A hallgatók reprodukálható bioinformatikai munkafolyamatot alakítanak ki HPC, GitLab/CI/CD, Python-alapú algoritmusok, sketching és klaszterezés, AutoML, valamint fehérje- és genomikai nyelvmodellek felhasználásával |
| Elsajátítandó elméleti ismeretanyag: | A kurzusban hangsúlyt helyezünk a nagy áteresztőképességű szekvenálási eljárások és a hozzájuk kapcsolódó összetett adatfeldolgozási munkafolyamatok bemutatására. Megjelenik a metagenomika, az RNA-seq stb. Ezen felül megjelenik az adatok hálózatos reprezentációja is. A kurzusban szerepet kapnak a szövegbányászati eszközök is az adathálózatok egyik legfontosabb rétegének megértéséhez. A kurzus során tárgyalt fontosabb fogalmak, koncepciók:
- Jaccard-hasonlóság, sketching és MinHash; bottom-k sketch, containment MinHash és HyperLogLog
- Klaszterezés és szekvenciagráfok
- Tanító- és tesztadatok szétválasztása, feature-szelekció, modellválasztás és keresztvalidáció; pontosság, szenzitivitás, specificitás és ROC-AUC
- Fehérje- és genomikai nyelvmodellek
- Fehérjeoptimalizálás és szerkezet-előrejelzés
- Genomikai modellek összehasonlítása
|
| Elsajátítandó gyakorlati ismeretanyag: |
- Munkavégzés HPC környezetben, SLURM.
- Verziókezelés és reprodukálhatóság, GitLab
- Az NCBI SRA adatbázis, SRA toolkit használata, adatok rendszerezése és előkészítése HPC környezetben.
- Python-alapú k-mer generálás és számlálás, Jaccard-hasonlóság, sketching és MinHash; bottom-k sketch, containment MinHash és HyperLogLog implementálása
- Read alapú patogénazonosítás, k-mer/sketch reprezentáció, összehasonlítás referencia-adatbázissal; találatok rangsorolása; hamis pozitív és hamis negatív eredmények, lefedettség
- Mohó klaszterezési algoritmus implementálása; hasonlósági küszöb, MMseqs2 Linclust és Bandage használata
- AutoML: JADBIO használata bioinformatikai osztályozási feladatokban
- ESM-alapú embeddingek készítése, vizualizálása, fehérje-lokalizációs osztályozás HPC/GPU környezetben
- ESMFold vagy ESM-alapú térszerkezet-előrejelzés használata; a predikciók megbízhatóságának értelmezése
|
| A 2-4 legfontosabb kötelező irodalom felsorolása bibliográfiai adatokkal (szerző, cím, kiadás adatai, (esetleg oldalak), ISBN): | Csaba Ortutay, Zsuzsanna Ortutay: Molecular Data Analysis Using R. Wiley-Blackwell, 2017. ISBN: 9781119165026. Melanie Kappelmann-Fenzl (szerk): Next generation sequencing and data analysis. Springer, 2021. ISBN: 9783030624897. |
| A 2-4 legfontosabb ajánlott felsorolása bibliográfiai adatokkal (szerző, cím, kiadás adatai, (esetleg oldalak), ISBN): | John Shawe-Taylor, Nello Cristianini: Kernel Methods for Pattern Analysis. Cambridge University Press, 2004. ISBN: 9780521813976. Dukka B. KC (szerk): Large Language Models (LLMs) in Protein Bioinformatics. Methods in Molecular Biology, volume 2941. Springer, 2025. ISBN: 9781071646229. |
| Elmélet-gyakorlat aránya: | Elméleti óra óraszáma: 2 Gyakorlati óra és labor óra óraszáma: 0 + 1 |
| Az alkalmazott oktatási módszerek: | Projektfeladat csoportban történő megoldása |
| Az értékelés módja: | |
| Az értékelés kritériuma: | Gyakorlatorientált, projektalapú oktatás; az előadások az elméleti és módszertani keretet adják, a gyakorlatok Python, GitLab és HPC környezetben történő kipróbálásra épülnek. A gyakorlatokon a hallgatók egyszerű algoritmusokat és modellalkalmazásokat implementálnak, mérnek és értelmeznek |
| Miként járul hozzá a tantárgy a KKK-ban megjelölt kompetenciaelemek megszerzéséhez: | Bioinformatika mesterképzés: A1: A kurzus során a hallgatók aktívan használják a korszerű bioinformatikai, molekuláris biológiai szaknyelvet A2: A bioinformatikai algoritmusok értő alkalmazása a kurzus lényegi részét teszi ki A4: A kurzus során megoldandó problémák során a hallgatók integrálják az informatikai és molekuláris biológiai ismereteiket A5: A kurzusban explicit módon előkerülnek a következő témakörök: szekvenciaelemzés, biostatisztika, molekuláris diagnosztikai adatfeldogozó eljárások, valamint a nagy áteresztőképességű molekuláris biológiai technikák adatainak tárolása, feldolgozása és értelmezése B1: A kurzusban bemutatott korszerű bioinformatikai alkalmazások közvetlen módon járulnak hozzá a hallgatók adatelemzési készségeinek fejlesztéséhez B2: A bemutatott adatelemzési eljárások alkalmasak a modern molekuláris biológiai problémák megoldására B3: A kurzusban bemutatott technikák alapvető fontosságúak a kurrens molekuláris biológiai kísérletek adatainak értő elemzésében B7: A kurzus során a hallgatók a klinikai gyakorlatban is alkalmazott ill. hasznosítható tudásra tesznek szert B8: A gyakorlatok során a hallgatók összetett munkafolyamatokat implementálnak megfelelő dokumentáció mellett B9: A hallgatók a projektmunka elvégzése során a releváns szakirodalmat is felhasználják C4: A kiadott feladatok megoldásához szükséges kritikus gondolkodás hozzájárul a saját és mások által elért eredmények objektív megítéléséhez C5: A csoportban végzett feladatok során a hallgatók megtanulják az egyes részfeladatok megéréséhez szükséges információk átadását C6: A hallgatók megismerik számos munkafolyamat jelenlegi lehetőségeit és inspirációt kapnak azok továbbfejlesztésére, adott alkalmazásokhoz való alakítására C7: A projektmunka során a hallgatóknak kreatívan kell alkalmazniuk a megtanult alapismereteket D1: A kurzusban szereplő munkafolyamatok készségszintű ismerete számos bioinformatikai elemzői munkakör betöltésének feltétele |