
i
BỘ GIÁO DỤC VÀ ĐÀO TẠO
TRƢỜNG ĐẠI HỌC NÔNG LÂM TP. HỒ CHÍ MINH
BỘ MÔN CÔNG NGHỆ SINH HỌC
************
KHÓA LUẬN TỐT NGHIỆP
KHAI THÁC DỮ LIỆU ESTs (EXPRESSED SEQUENCE
TAGs) Ở CHI CAM CHANH (CITRUS) CHO VIỆC PHÁT
TRIỂN MARKER PHÂN TỬ SSR (SIMPLE SEQUENCE
REPEATS)
Ngành học: CÔNG NGHỆ SINH HỌC
Niên khóa: 2003-2007
Sinh viên thực hiện: LƢU TRẦN CÔNG HUY
Thành phố Hồ Chí Minh
Tháng 9/2007

ii
LỜI CẢM ƠN
Xin gửi lòng biết ơn sâu sắc đến ba mẹ và gia đình đã hết lòng hỗ trợ, động viên về
mọi mặt để tôi hoàn thành đề tài.
Xin chân thành cảm tạ
Ban Giám hiệu Trƣờng Đại học Nông Lâm Thành Phố Hồ Chí Minh
Ban chủ nhiệm Bộ Môn Công nghệ Sinh Học cùng tất cả quý thầy cô đã
truyền đạt kiến thức cho tôi trong suốt quá trình học tại trƣờng.
Chân thành cảm ơn
TS. Trần Thị Dung đã tận tình hƣớng dẫn, giúp đỡ tôi trong suốt thời gian
thực hiện đề tài tốt nghiệp.
Xin cảm ơn CN. Lƣu Phúc Lợi đã giúp đỡ, hỗ trợ kiến thức và tài liệu chuyên môn.
Xin cảm ơn bạn bè thân yêu của lớp DH03SH đã chia sẻ cùng tôi những vui buồn
trong thời gian học cũng nhƣ hết lòng hỗ trợ, giúp đỡ tôi trong thời gian thực hiện
đề tài.
Tp. Hồ Chí Minh tháng 08 năm 2007
Sinh viên thực hiện
Lƣu Trần Công Huy

iii
TÓM TẮT KHOÁ LUẬN
LƢU TRẦN CÔNG HUY, Đại Học Nông Lâm TP. Hồ Chí Minh, tháng
07/2007. “KHAI THÁC DỮ LIỆU ESTs (EXPRESSED SEQUENCE TAGs) Ở
CHI CAM CHANH (CITRUS) CHO VIỆC PHÁT TRIỂN MARKER PHÂN
TỬ SSR (SIMPLE SEQUENCE REPEATS)”
Hội đồng hƣớng dẫn
TS. Trần Thị Dung
Cử Nhân. Lƣu Phúc Lợi
Khóa luận đƣợc thực hiện tại bộ môn Công Nghệ Sinh Học, trƣờng đại học
Nông Lâm TP. Hồ Chí Minh, trong khoảng thời gian từ tháng 3/2007 đến 8/2007.
Trong những năm qua, sinh học không ngừng phát triển và đã tạo ra những
kho dữ liệu miễn phí và trực tuyến rất lớn về trình tự gene, protein, bộ gene ... của
thực vật lẫn động vật nhƣ các cơ sở dữ liệu sinh học lớn nhƣ NCBI, EMBL,
DDBj…. Một trong những CSDL lớn đó là ESTs (Expressed Sequence Tags), trong
đó có ESTs của chi cam chanh (citrus). Những trình tự ESTs này có thể đƣợc sử
dụng để khai thác các SSRs (Simple Sequence Repeats). Những SSRs này rất hữu
ích vì chúng có rất nhiều ứng dụng nhƣ genome mapping, phenotype mapping và
chọn giống thực vật nhờ marker phân tử. Hơn thế nữa, việc phát triển marker SSR
từ EST có chi phí rất thấp so với phƣơng pháp phân lập SSR truyền thống.
Để đạt đƣợc mục tiêu trên, khóa luận cần đảm bảo thực hiện những nội dung nhƣ
sau:
1) Dùng Perl script để thu nhận trình tự các nucleotide của ESTs của Citrus
vừa tìm từ trang cơ sở dữ liệu GenBank NCBI.
2) Tìm và tách các đoạn microsatellite có thể có trong mỗi đoạn gen.
3) Tìm SSR nằm trên vùng gen kháng virus Tristeza

iv
4) Tìm hiểu về mô hình dữ liệu quan hệ, sử dụng mô hình này vào việc lƣu
trữ dữ liệu các trình tự nucleotide và trình tự SSRs của chi cam chanh (Citrus), và
tạo cơ sở dữ liệu chứa những trình tự này. Sau đó đƣa các dữ liệu này vào cơ sở dữ
liệu chính.
5) Trang web đƣợc thiết kế để chia sẻ thông tin trực tuyến với ngƣời dùng
Kết quả
Thu nhận đƣợc 191.110 trình tự ESTs của các loài Citrus đƣợc thu thập từ
CSDL dbEST và CoreNucleotide của GenBank. Những trình tự ESTs này đƣợc tìm
các vùng lặp lại, từ đó xác định đƣợc 28.241 SSRs trong 190412 ESTs . 19755
primers đƣợc thiết kế trên vùng flanking của các SSRs. Các primers này đã đƣợc
kiểm tra sự lặp lại và sự bắt cặp đặc hiệu bằng BLAST. Cơ sở dữ liệu có 28241
trình tự SSRs đƣợc chuyển vào CSDL quan hệ và tích hợp vào website BUILDING
SSRs DATABASE of Citrus. Sau khi đƣợc loại bỏ các trình tự tạp, nhiễu và dấu
các trình tự ở các bào quan, trình tự lặp lại và trình tự vector, các trình tự ESTs
đƣợc phân nhóm thành 2 nhóm Contigs và Singletons. Việc nhóm các trình tự giúp
ích cho việc giảm bớt các trình tự dƣ thừa, kéo dài các EST-SSR và xác định các
trình tự bảo tồn. Kết quả là thêm 1071 primers đƣợc thiết kế cho các EST-SSR đƣợc
kéo dài. Ngoài ra, chúng tôi cũng xác định đƣợc 33 EST-SSRs tƣơng đồng gene
kháng virus Tristeza bằng công cụ BLAST với ngƣỡng e-value = 10-10

v
ABSTRACT
LUU TRAN CONG HUY, NONG LAM UNIVERSITY, DATA MINING
FOR DEVELOPING SIMPLE SEQUENCE REPEATS (SSR) MARKER IN
EXPRESSED SEQUENCE TAGS (ESTs) FROM CITRUS
Supervisor:
Dr Trần Thị Dung
Bsc Lƣu Phúc Lợi
The research was carried out at the department of biotechnology at Nong
Lam University.
Recent advances in genomic technologies have generated a vast amount of
publicly available expressed sequence tags (ESTs) in Citrus. These data can be
mined to identify Simple sequence repeats (SSRs) or microsatellites. These SSRs
are useful because of a broad range of application, such as genome mapping and
characterization, phenotype mapping, marker assisted selection of plant breeding,
additional map-based cloning of important genes. Moreover, this method of
developing SSR marker from ESTs is inexpensive comparing to the traditional
methods.
Methodology
1) We used perl script to receive EST sequences from database NCBI
2) Finded and separated SSRs include in ESTs database
3) We were learning about relationship database model to used to saved
nucleotide, SSRs citrus sequences data and created database contain them.
4) Finding SSR which are homologous with tristeza virus resistance gene.
5) Designed web that contain database control software to share information
with users
Results:
28,241 SSR-containing ESTs (EST-SSRs) were identified by analyzing
191,110 ESTs sequences belonging to Citrus in dbEST division of GenBank.
19,755 primers, which were filtered with repetition checking and BLAST checking,

