پیدا کردن اطلاعات پایه یک ژن
بتوانید نام کامل ژن، نامهای دیگر (Synonyms) و محل دقیق قرارگیری آن روی کروموزوم را در Ensembl پیدا کنید.
در این تمرین قرار نیست فقط اطلاعات آماده را بخوانید. شما باید با جستوجوی مستقیم در پایگاه داده Ensembl ساختار سه ژن مهم انسانی را بررسی کنید، موقعیت کروموزومی، طول ژن، Transcriptها، اگزونها و اینترونها را پیدا کنید و تفاوت میان Gene، Transcript و Isoform را در عمل ببینید.
هدف این تمرین حفظکردن اطلاعات سه ژن نیست؛ قرار است یاد بگیرید چگونه اطلاعات ساختاری یک ژن را مستقیماً از یک پایگاه داده معتبر استخراج، تفسیر و با ژنهای دیگر مقایسه کنید.
بتوانید نام کامل ژن، نامهای دیگر (Synonyms) و محل دقیق قرارگیری آن روی کروموزوم را در Ensembl پیدا کنید.
طول ژن را بر اساس مختصات ژنومی بررسی کنید و ارتباط میان ساختار ژن، اگزونها و اینترونها را در یک نمونه واقعی مشاهده کنید.
ببینید یک ژن میتواند چند Transcript داشته باشد و Canonical Transcript را از میان Transcriptهای مختلف تشخیص دهید.
اطلاعات BRCA1، TP53 و CFTR را کنار یکدیگر قرار دهید و تفاوت ساختاری آنها را تحلیل کنید.
در عمل متوجه شوید که Gene، Transcript و Protein Isoform سه مفهوم متفاوت هستند و نباید به جای یکدیگر استفاده شوند.
بهجای جستوجوی یک جواب آماده در اینترنت، یاد بگیرید اطلاعات موردنیاز یک پروژه بیوانفورماتیکی را مستقیماً از دیتابیس مرجع استخراج کنید.
در پایان این تمرین باید بتوانید تنها با داشتن نام یک ژن، وارد Ensembl شوید و اطلاعات مهم ساختاری و Transcriptهای آن را بهصورت مستقل پیدا و تفسیر کنید.
این سه واژه را در Ensembl بارها خواهید دید. اگر تفاوت آنها را از همین ابتدا بدانید، اطلاعات صفحه یک ژن بسیار قابلفهمتر خواهد شد.
نکته مهم: یک ژن الزاماً فقط یک Transcript و یک محصول نهایی ندارد. یک ناحیه ژنومی میتواند منجر به تولید چند RNA متفاوت شود و برخی از Transcriptهای پروتئینکدکننده نیز میتوانند محصولات پروتئینی متفاوتی ایجاد کنند.
ژن را میتوان یک ناحیه مشخص از DNA ژنومی در نظر گرفت که اطلاعات لازم برای تولید یک یا چند محصول RNA را در خود دارد. ژن یک موقعیت مشخص روی کروموزوم دارد و میتواند شامل اگزونها، اینترونها و نواحی تنظیمی باشد.
Transcript یک محصول RNA است که از یک ژن ایجاد میشود. یک ژن میتواند بیش از یک Transcript داشته باشد. Transcriptهای مختلف ممکن است از ترکیب متفاوت اگزونها، محل شروع یا پایان متفاوت، یا الگوهای متفاوت splicing ایجاد شوند.
در این تمرین وقتی از Isoform صحبت میکنیم، منظور معمولاً شکلهای متفاوت یک محصول پروتئینی است که میتوانند از Transcriptهای پروتئینکدکننده متفاوت یک ژن ایجاد شوند.
یک Gene میتواند چند Transcript داشته باشد و برخی Transcriptها میتوانند محصولات پروتئینی متفاوتی ایجاد کنند.
فرض کنید ژن خیالی GENE-X دارای شش اگزون باشد. سلول الزاماً در تمام RNAهای تولیدشده از این ژن، دقیقاً از همان ترکیب اگزونی استفاده نمیکند.
وقتی EGFR را در Ensembl جستوجو میکنید، صفحه Gene درباره کل ناحیه ژنی EGFR اطلاعات میدهد. اما وقتی یکی از Transcriptهای آن را انتخاب میکنید، وارد اطلاعات همان RNA مشخص میشوید. بنابراین مختصات، تعداد اگزونها و سایر جزئیات یک Transcript نباید بدون توجه به نوع صفحه با اطلاعات کل Gene اشتباه گرفته شود.
فرض کنید یک ژن پنج Transcript دارد. این موضوع بهتنهایی به این معنی نیست که حتماً پنج Protein Isoform نیز وجود دارد. برخی Transcriptها ممکن است protein-coding نباشند یا محصول پروتئینی مستقلی ایجاد نکنند. بنابراین عبارتهای Number of Transcripts و Number of Protein Isoforms الزاماً یک عدد را نشان نمیدهند.
فرض کنید Transcript اصلی یک ژن ۱۰ اگزون داشته باشد، اما Transcript دیگری از همان ژن فقط ۸ اگزون را در ساختار نهایی خود داشته باشد. در این حالت پاسخ دادن به سؤال «این ژن چند اگزون دارد؟» بدون مشخصکردن Transcript میتواند مبهم باشد. به همین دلیل در این تمرین تعداد اگزونها را بر اساس Canonical Transcript گزارش خواهید کرد.
در بخش اصلی تمرین شما همین مفاهیم را برای BRCA1، TP53 و CFTR بررسی خواهید کرد. ممکن است هنگام مشاهده صفحه این ژنها ببینید که هر ژن مجموعهای از Transcriptهای مختلف دارد. وظیفه شما این است که بهجای حدسزدن، اطلاعات را مستقیماً از Ensembl استخراج کنید.
اگر هنوز تفاوت این سه مفهوم کمی مبهم است، یک کتاب را تصور کنید.
برای اینکه دقیقاً بدانید در Ensembl باید دنبال چه چیزی بگردید، یک بار مسیر کامل استخراج اطلاعات را با ژن EGFR انجام میدهیم. سپس شما همین مسیر را بهصورت مستقل برای BRCA1، TP53 و CFTR تکرار خواهید کرد.
EGFR یک ژن پروتئینکدکننده شناختهشده است و صفحه آن در Ensembl مثال مناسبی برای دیدن موقعیت ژنومی، Transcriptهای متعدد، Canonical Transcript و ساختار اگزونی است. نکته مهم این است که EGFR جزو سه ژن سؤال شما نیست؛ بنابراین این آموزش روش کار را نشان میدهد، نه جواب تمرین را.
وارد سایت Ensembl شوید و در قسمت جستوجو عبارت EGFR را وارد کنید. چون ژنهای همنام یا مشابه ممکن است در گونههای دیگر نیز وجود داشته باشند، حتماً نتیجه مربوط به Homo sapiens را انتخاب کنید.
اولین کاری که بعد از ورود به صفحه ژن انجام میدهیم، بررسی نام رسمی ژن و نامهای دیگری است که برای همان ژن استفاده شدهاند.
Gene Symbol:
EGFR
Full Gene Name:
Epidermal Growth Factor Receptor
نمونهای از Synonymها:
ERBB1, HER1
برای BRCA1، TP53 و CFTR نیز باید نام کامل و Synonymهای هر ژن را پیدا و در فایل Word ثبت کنید.
در صفحه Gene به قسمت Location توجه کنید. این قسمت مشخص میکند ژن روی کدام کروموزوم قرار دارد، از چه مختصاتی شروع و در چه مختصاتی تمام میشود و روی Forward یا Reverse Strand است.
Chromosome: 7
Location:
55,018,820 – 55,211,628
Strand:
Forward (+)
اگر Start و End ژن را داشته باشید، طول ناحیه ژنومی را میتوانید خودتان محاسبه کنید. چون مختصات Ensembl شامل هر دو نقطه ابتدا و انتها است، فرمول به شکل زیر خواهد بود:
55,211,628 − 55,018,820 + 1
= 192,809 bp
چون میخواهیم دانشجو مفهوم Start، End و طول یک Feature ژنومی را بفهمد، نه اینکه فقط یک عدد آماده را از صفحه کپی کند.
حالا به بخش Transcriptها بروید. اینجا خواهید دید که EGFR فقط یک Transcript ندارد. Transcriptها میتوانند طول، ساختار اگزونی، Biotype و محصول پروتئینی متفاوتی داشته باشند.
در نسخه فعلی Ensembl، برای EGFR چندین Transcript ثبت شده است و صفحه Gene در حال حاضر 17 Transcript را گزارش میکند.
در جدول Transcriptها به Flagها یا برچسبهای کنار هر Transcript توجه کنید. Ensembl یکی از Transcriptها را بهعنوان Ensembl Canonical مشخص میکند.
یکی از Transcriptهای اصلی EGFR در نسخه فعلی:
EGFR-201
ENST00000275493.7
نکته: Canonical به معنی «تنها Transcript درست ژن» نیست. ژن میتواند Transcriptهای واقعی و زیستی متعدد داشته باشد. Canonical یک Transcript منتخب است که برای نمایش و تحلیل مرجع ژن استفاده میشود.
حالا روی Canonical Transcript کلیک کنید. شما دیگر در صفحه کل Gene نیستید؛ وارد صفحه یک Transcript مشخص شدهاید.
تعداد Exonهای
Canonical Transcript
را ثبت کنید.
سپس برای یک Transcript خطی معمول:
Number of Introns = Number of Exons − 1
اگر Transcript دیگری را انتخاب کنید ممکن است تعداد Exonهای متفاوتی ببینید. به همین دلیل در تمرین اصلی صراحتاً از شما تعداد Exon و Intron Canonical Transcript خواسته میشود.
دقیقاً همین مسیر را در بخش اصلی تمرین برای سه ژن دیگر انجام خواهید داد.
توجه: اطلاعات ژنومی و Annotationها ممکن است با انتشار نسخههای جدید Ensembl تغییر کنند. در پاسخ تمرین، اطلاعاتی را ثبت کنید که هنگام انجام تمرین در Homo sapiens / GRCh38 مشاهده میکنید.
مسیر کار را با EGFR دیدید. حالا بدون استفاده از پاسخ آماده، همان مراحل را برای سه ژن BRCA1، TP53 و CFTR انجام دهید و اطلاعات خواستهشده را مستقیماً از Ensembl استخراج کنید.
اولین ژن مأموریت شما. وارد صفحه Gene شوید، اطلاعات ساختاری و Transcriptهای آن را بررسی کنید و نتایج را در فایل پاسخ ثبت کنید.
ژن شماره ۱دومین ژن را با همان روش بررسی کنید. تلاش کنید تفاوت ساختار و Transcriptهای آن را با ژن اول نیز در ذهن داشته باشید.
ژن شماره ۲سومین ژن مأموریت را بررسی کنید. پس از تکمیل این ژن، اطلاعات هر سه ژن را کنار یکدیگر قرار خواهید داد.
ژن شماره ۳این موارد را برای هر سه ژن بهصورت جداگانه استخراج کنید. پاسخها باید بر اساس اطلاعاتی باشند که خودتان در Ensembl مشاهده کردهاید.
تعداد Exon و Intron را برای Canonical Transcript گزارش کنید؛ نه برای یک Transcript تصادفی.
تعداد Transcriptها ممکن است در نسخههای آینده Ensembl تغییر کند. به همین دلیل تاریخ بررسی خود را نیز در پاسخ ثبت کنید.
برای هر یک از ژنهای BRCA1، TP53 و CFTR موارد زیر را بهصورت جداگانه از Ensembl استخراج کنید. هدف این است که برای هر فیلد بدانید چه چیزی را میخواهید، کجا باید دنبالش بگردید و چگونه آن را گزارش کنید.
نام رسمی و کامل ژن را ثبت کنید؛ نه فقط Gene Symbol کوتاه آن.
نامها، مخففها یا عناوین دیگری را که برای همان ژن ثبت شدهاند پیدا کنید.
مشخص کنید ژن روی کدام کروموزوم قرار دارد و مختصات شروع و پایان آن را نیز ثبت کنید.
مشخص کنید ژن روی کدام Strand ژنوم قرار دارد. این اطلاعات را با جهت Transcript اشتباه نگیرید.
طول ناحیه ژنومی ژن را بر حسب bp محاسبه و گزارش کنید.
تعداد Transcriptهای ثبتشده برای ژن را در زمان انجام تمرین گزارش کنید.
Transcriptی را که در Ensembl با عنوان Canonical مشخص شده است پیدا کنید و نام آن را ثبت کنید.
وارد Canonical Transcript شوید و تعداد اگزونهای همان Transcript را گزارش کنید.
یک ژن میتواند Transcriptهای متعددی داشته باشد و Transcriptهای مختلف الزاماً ساختار اگزونی یکسانی ندارند. بنابراین سؤال «این ژن چند اگزون دارد؟» بدون مشخصکردن Transcript میتواند مبهم باشد. در این تمرین برای اینکه همه پاسخها مبنای یکسان داشته باشند، شمارش را بر اساس Canonical Transcript انجام میدهیم.
در فایل Word برای BRCA1، TP53 و CFTR یک بخش مشابه این ساختار ایجاد کنید و اطلاعات استخراجشده را مقابل هر مورد بنویسید.
توجه: اطلاعات مربوط به Transcriptها را از صفحه یک Transcript تصادفی برندارید. ابتدا Canonical Transcript را مشخص کنید و سپس تعداد Exon و Intron را بر اساس همان Transcript گزارش دهید.
پس از تکمیل اطلاعات BRCA1، TP53 و CFTR، به پرسشهای زیر پاسخ دهید. پاسخ این قسمت باید بر اساس دادههایی باشد که خودتان در بخش قبل از Ensembl استخراج کردهاید.
در این قسمت جواب یککلمهای کافی نیست. برای هر سؤال ابتدا نتیجه را بنویسید و سپس با استفاده از دادههایی که استخراج کردهاید، دلیل یا محاسبه خود را نیز توضیح دهید.
طول ژنهای BRCA1، TP53 و CFTR را با یکدیگر مقایسه کنید. مشخص کنید طولانیترین و کوتاهترین ژن کداماند.
نام ژنها + طول هرکدام بر حسب bp + نتیجه مقایسه.
فقط گفتن اینکه یک ژن بزرگتر است کافی نیست. نسبت طول ژن بزرگتر به ژن کوچکتر را نیز محاسبه کنید.
تمرین مقایسه کمی دادههای ژنومی، نه فقط مقایسه ظاهری اعداد.
تعداد Transcriptهای سه ژن را کنار هم قرار دهید و مشخص کنید کدام ژن در نسخهای از Ensembl که بررسی کردهاید Transcript بیشتری دارد.
تاریخ بررسی را نیز ذکر کنید، زیرا Annotationهای Ensembl ممکن است در آینده تغییر کنند.
توضیح دهید چرا نمیتوان صرفاً با مشاهده تعداد Transcriptهای یک ژن، نتیجه گرفت همان تعداد Protein Isoform نیز وجود دارد.
آیا همه Transcriptها protein-coding هستند؟ آیا هر Transcript الزاماً محصول پروتئینی متفاوتی ایجاد میکند؟
طول ژن و تعداد Exonهای Canonical Transcript هر سه ژن را با هم مقایسه کنید و بررسی کنید آیا افزایش طول ژن الزاماً با افزایش تعداد Exon همراه است یا خیر.
بخش زیادی از طول یک ژن میتواند مربوط به Introns باشد.
توضیح دهید چرا گفتن اینکه «یک ژن چند Exon دارد» بدون مشخص کردن Transcript میتواند پاسخ دقیقی نباشد.
Transcriptهای مختلف یک ژن چگونه میتوانند ساختار اگزونی متفاوتی داشته باشند؟
Strand سه ژن را مقایسه کنید. اگر یکی از ژنها روی Reverse Strand قرار داشت، توضیح دهید Reverse Strand بودن چه مفهومی دارد.
Reverse بودن به معنی «معکوس یا خراب بودن ژن» نیست؛ موضوع مربوط به جهت رونویسی نسبت به Reference Genome است.
در ۳ تا ۵ جمله توضیح دهید بررسی واقعی این سه ژن چه چیزی درباره تنوع ساختار ژنها و Transcriptها به شما نشان داد.
مهم است نتیجهگیری شما بر اساس دادههایی باشد که واقعاً استخراج کردهاید.
لازم نیست پاسخها طولانی باشند؛ اما باید نشان دهند که داده را دیدهاید، مقایسه کردهاید و درباره آن فکر کردهاید.
پاسخهای آماده اینترنتی هدف این بخش نیستند. سؤالات تحلیلی را بر اساس همان دادههایی پاسخ دهید که خودتان برای BRCA1، TP53 و CFTR از Ensembl استخراج کردهاید. اگر Annotationها در آینده تغییر کنند، ممکن است بخشی از اعداد شما با پاسخ فرد دیگری متفاوت باشد.
برای اینکه پاسخ همه دانشجویان ساختار یکسانی داشته باشد، یک فایل Word آماده در اختیار شما قرار دادهایم. فایل را دانلود کنید، اطلاعات سه ژن و پاسخ سؤالات تحلیلی را داخل همان فایل تکمیل کنید.
نیازی نیست جدول یا ساختار پاسخ را خودتان طراحی کنید. تمام بخشهای موردنیاز تمرین از قبل در فایل قرار گرفتهاند؛ فقط کافی است اطلاعاتی را که از Ensembl استخراج کردهاید در محل مناسب وارد کنید.
فایل را دانلود کرده و با Microsoft Word یا نرمافزار سازگار با DOCX باز کنید.
⬇ دانلود قالب Word تمرینپیشنهاد: قبل از ارسال، نام فایل را به نام و نام خانوادگی خود تغییر دهید؛ مثلاً: Exercise-02-Ali-Ahmadi.docx
پاسخ خود را در فایل Word با فرمت DOCX آماده کنید و از فرم زیر ارسال نمایید. حداکثر حجم فایل ۵ مگابایت است.
دوره: بیوانفورماتیک مقدماتی
میتوانید به تمرین قبلی دوره برگردید و دوباره جستوجوی Variant و تفسیر اطلاعات آن را مرور کنید.
اگر انجام این تمرین برایتان مفید بود، در دوره بیوانفورماتیک مقدماتی کاوش آموز قدمبهقدم یاد میگیرید چگونه با پایگاههای داده زیستی کار کنید، اطلاعات ژنها و واریانتها را استخراج کنید و بهجای حفظکردن مطالب، مهارت واقعی کار با دادههای بیولوژیک را به دست آورید.
جزئیات دوره، سرفصلها و مسیر آموزشی را ببینید و یادگیری بیوانفورماتیک را بهصورت منظم و عملی ادامه دهید.
بعد از ارسال فایل، دیدگاه خود را ثبت کنید
پس از اینکه فایل Word پاسخ تمرین را با موفقیت ارسال کردید، یک کار کوتاه دیگر باقی مانده است: حضور و انجام تمرین خود را در بخش دیدگاههای همین صفحه ثبت کنید.
فایل Word را ارسال کنید
ابتدا فایل تکمیلشده تمرین را از فرم ارسال پاسخ همین صفحه آپلود کنید.
به بخش دیدگاهها بروید
پس از مشاهده پیام موفقیت ارسال فایل، به قسمت دیدگاههای پایین همین صفحه بروید.
نام کامل خود را ثبت کنید
عبارت مشخصشده را همراه با نام و نام خانوادگی کامل خود در دیدگاه بنویسید.
فایل Word پاسخ کامل تمرین شماست؛ اما دیدگاه باعث میشود انجام تمرین در خود صفحه نیز ثبت شود و مدرسهای دوره بتوانند مشارکت دانشجویان را راحتتر دنبال کنند. نیازی نیست پاسخ کامل تمرین را داخل دیدگاه کپی کنید.