Что такое биоинформатика? Банк SwissProt С.А.Спирин 7, 8,10 февраля 2006 г., ФББ МГУ.

Slides:



Advertisements
Similar presentations
Genome Annotation: A Protein-centric Perspective.
Advertisements

Парламентские библиотеки: прошлое и будущее Присцилла Бэйнз Директор Библиотеки, Палата общин, Санкт-Петербург, октябрь 2004 г.
Банки информации в молекулярной биологии С.А.Спирин 11/III – 2006.
Биоинформатика Исследование информационных процессов в биологических системах (клетках, органах, организме, популяции). Изучение и внедрение в компьютерную.
Курс «Биоинформатика» ф-т биоинженерии и биоинформатики МГУ А.В. Алексеевский. Использованы материалы лекций А.Б.Рахманиновой и С.А.Спирина.
Вводная лекция Курс «Биоинформатика» ф-т биоинженерии и биоинформатики МГУ А.Б.Рахманинова, 3/IX – 2007, использованы материалы лекции С.А.Спирина, 2006.
Поиск оптимального набора параметров оптимизаций компилятора Брусенцов Леонид Евгеньевич студент 4 курса ФИТ НГУ Руководители:Илья.
ВятГУ «"Обеспечение доступа участников национальной нанотехнологической сети к электронным источникам НТИ” (ФЦП "Развитие инфраструктуры наноиндустрии.
Дипломная работа Ивановой О.О., группа 545 Научный руководитель: д. ф.-м. н., профессор Терехов А.Н. Генерация кода по диаграмме активностей.
Генная инженерия.
Тушин Александр, ЗАО «Компания Либэр». 1) Предоставление полнотекстовых материалов 2) Поиск по внутреннему содержанию документа 3) Доступность в режиме.
Устинович Андрей М-28.  Реализация стратегии в области микроэлектроники позволила сократить технологическое отставание российских производителей до 5-ти.
Определение необходимого уровня запасов на складе.
О ПЫТ ОРГАНИЗАЦИИ КОНТРОЛЯ САМОСТОЯТЕЛЬНОЙ РАБОТЫ СТУДЕНТОВ И КАЧЕСТВА ОБУЧЕНИЯ НА БАЗЕ ЦЕНТРА ДИСТАНЦИОННОГО ОБРАЗОВАНИЯ Ю ЖНОГО ФЕДЕРАЛЬНОГО УНИВЕРСИТЕТА.
Создание сервиса синхронизации разнородных баз данных Допущена к защите зав. кафедрой: д.ф.м.н., профессор Терехов А.Н. Научный руководитель: доцент Графеева.
Protein databases Morten Nielsen. Background- Nucleotide databases GenBank, National Center for Biotechnology Information.
Инновационные разработки в области новых методов лечения заболеваний Проф. О.С.Медведев ФФМ, МГУ им. М.В.Ломоносова.
Archives and Information Retrieval
Блок 3. Семейства белков I. Множественное выравнивание Первый курс, весна 2008, А.Б.Рахманинова.
Курс «Биоинформатика» ф-т биоинженерии и биоинформатики МГУ А.В. Алексеевский. Использованы материалы лекций А.Б.Рахманиновой и С.А.Спирина.
Euroland.com Сентябрь 2009 «IR сайты крупнейших российских компаний в системе восприятия европейской целевой аудитории»
Анализ аминокислотной последовательности: паттерны, домены, семейства … или что, где и как искать?
ERAMIS “Network Europe – Russia – Asia of Masters in Informatics as a Second competence” (ERAMIS) «Магистратура по информатике как вторая компетенция для.
Apache Harmony или как сделать курсовую работу в рамках этого проекта Фурсов Михаил.
Функции Введение А.Б.Рахманинова (13-14 марта 2007г.)
EDCWiki Electronic Document Circulation using wiki Система электронного документооборота на основе wiki Участники: Кузьмин Константин, Цыцулин Виталий.
Determinants of bank interest margins in Russia: Does bank ownership matter? Zuzana Fungáčová and Tigran Poghosyan Горбачев Е., Мальцева Е., 317 группа.
Protein Databases EBI – European Bioinformatics Institute
"The European Molecular Biology Open Software Suite"
Оптимизация Just – in - time компилятора методом профилирования значений Соколов Андрей Владимирович, ФФ НГУ, 3 курс, Руководитель:
Автор: Новитская О.В.. Об авторе: Н Новитская Ольга Владимировна Студентка Кемеровского Государственного Университета физического факультета 4 курса группы.
Высокопроизводительные вычисления в биоинформатике 1.
Gtcactaaatactttaaccaatataggcatagcgcacagacagataaaaattacagagtacacaacatccatgaaacgcattagcaccaccattaccaccaccatcaccattacca gcttttcattctgactgcaacgggcaatatgtctctgtgtggattaaaaaaagagtgtctgatagcagcttctgaactggttacctgccgtgagtaaattaaaattttattgactta.
Protein databases Henrik Nielsen. Background- Nucleotide databases GenBank, National Center for Biotechnology Information.
Swiss-Prot – одна из первых баз данных белковых последовательностей, “gold standard” белковой аннотации. Аннотация выполнена вручную группой профессиональных.
Gtcactaaatactttaaccaatataggcatagcgcacagacagataaaaattacagagtacacaacatccatgaaacgcattagcaccaccattaccaccaccatcaccattacca gcttttcattctgactgcaacgggcaatatgtctctgtgtggattaaaaaaagagtgtctgatagcagcttctgaactggttacctgccgtgagtaaattaaaattttattgactta.
Class European Resources Protein Focused. Protein Databases EBI – European Bioinformatics Institute
BioUML интегрированная расширяемая среда для моделирования биологических систем Biosoft.Ru Лабоработория Биоинформатики КТИ ВТ СО РАН
ИЗУЧЕНИЕ ПОЧВЕННОГО ОРГАНИЧЕСКОГО ВЕЩЕСТВА МЕТОДАМИ ЭЛЕКТРОФОРЕЗА И ХРОМАТОГРАФИИ ВЫСОКОГО ДАВЛЕНИЯ Матыченков В.В. *, Бочарникова Е.А. ** *Институт фундаментальных.
Разработка алгоритмов распознавания текста
EBI is an Outstation of the European Molecular Biology Laboratory. UniProt Jennifer McDowall, Ph.D. Senior InterPro Curator Protein Sequence Database:
Демидов А.В г. Операционные системы Лекция 4 Работа с файлами.
Учитель биологии ГОУ ЦО №1470 Селезнёва И.Г.. « Рост, размножение, подвижность, возбудимость, способность реагировать на изменения внешней среды – все.
Как найти последовательность, кодирующую Ваш белок? Как найти последовательность ДНК, кодирующую Ваш белок: – Ссылки из белковых баз данных – Прямой поиск.
Cравнение биологических последовательностей А.Б.Рахманинова, 2008.
UniProt - The Universal Protein Resource
Анализ аминокислотной последовательности: паттерны, домены, семейства … или что, где и как искать?
Множественное выравнивание С.А.Спирин, весна
Инициативный проект Российского семинара по оценке методов информационного поиска (РОМИП)
Protein Sequence Analysis - Overview Raja Mazumder Senior Protein Scientist, PIR Assistant Professor, Department of Biochemistry and Molecular Biology.
The PIR-PSD current release 78.03, November 24, 2003, contains entries. 65 proteins The PIR was established in 1984 by the National Biomedical.
Bioinformatics.
Databases in Bioinformatics and Systems Biology Carsten O. Daub Omics Science Center RIKEN, Japan May 2008.
Introduction to databases Tuomas Hätinen. Topics File Formats Databases -Primary structure: UniProt -Tertiary structure: PDB Database integration system.
UniProt Non-redundant Reference Cluster (UniRef) Databases Swiss Institute of Bioinformatics (SIB) European Bioinformatics Institute (EMBL-EBI)
Post-graduate student of MIPT Chernov Evgeny Institute for System Programming of RAS 2010.
Автор в фокусе «Научное издание международного уровня : повышение качества и расширение присутствия в мировых информационных ресурсах» Москва, 21.
Function preserves sequences
Человеко-машинное взаимодействие Лекция 6 Мерзлякова Екатерина Юрьевна к.т.н. доцент ПМиК.
Protein Sequence Analysis - Overview - NIH Proteomics Workshop 2007 Raja Mazumder Scientific Coordinator, PIR Research Assistant Professor, Department.
EMBL – EBI European Bioinformatics Institute UniProt - The Universal Protein Resource Claire O’Donovan.
Central hub for biological data UniProtKB/Swiss-Prot is a central hub for biological data: over 120 databases are cross-referenced (EMBL/DDBJ/GenBank,
Gtcactaaatactttaaccaatataggcatagcgcacagacagataaaaattacagagtacacaacatccatgaaacgcattagcaccaccattaccaccaccatcaccattacca gcttttcattctgactgcaacgggcaatatgtctctgtgtggattaaaaaaagagtgtctgatagcagcttctgaactggttacctgccgtgagtaaattaaaattttattgactta.
Gtcactaaatactttaaccaatataggcatagcgcacagacagataaaaattacagagtacacaacatccatgaaacgcattagcaccaccattaccaccaccatcaccattacca gcttttcattctgactgcaacgggcaatatgtctctgtgtggattaaaaaaagagtgtctgatagcagcttctgaactggttacctgccgtgagtaaattaaaattttattgactta.
Сергей Копорулин | Эксперт по технологиям | Microsoft
Protein databases Henrik Nielsen
생물정보학 Bioinformatics.
UniProt: Universal Protein Resource
UniProt: the Universal Protein Resource
SUBMITTED BY: DEEPTI SHARMA BIOLOGICAL DATABASE AND SEQUENCE ANALYSIS.
Presentation transcript:

Что такое биоинформатика? Банк SwissProt С.А.Спирин 7, 8,10 февраля 2006 г., ФББ МГУ

Что такое биоинформатика? Исследование информационных процессов в биологических системах (клетках, органах, организме, популяции). Изучение и внедрение в компьютерную науку «биологических» методов анализа информации (нейросетей, генетических алгоритмов, нечеткой логики и др.). Применение компьютерных методов для решения биологических задач. Телепатия, парапсихология, информационные поля и т.п. ?

Биоинформатика Исследование информационных процессов в биологических системах (клетках, органах, организме, популяции). Изучение и внедрение в компьютерную науку «биологических» методов анализа информации (нейросетей, генетических алгоритмов, нечеткой логики и др.). Применение компьютерных методов для решения биологических задач. Телепатия, парапсихология, информационные поля и т.п.

Примеры задач биоинформатики Разработка алгоритмов для анализа большого объема биологических данных –Алгоритм поиска генов в геноме Анализ и интерпретация биологических данных таких, как нуклеотидные и аминокислотные последовательности, структура молекул белков, структура комплексов молекул белков с другими молекулами. –Изучение структуры активного центра белка Разработка программного обеспечения для управления и быстрого доступа к биологическим данным –Создание банка данных аминокислотных последовательностей

Что понимать под биоинформатикой? Как видим, смысл термина ещё ỳже... Применение компьютерных методов для решения биологических задач Применение компьютерных методов для решения задач молекулярной биологии... и еще ỳже... Компьютерный анализ экспериментальных данных о структурах биологических макромолекул (белков и нуклеиновых кислот) с целью получения биологической информации

Итак... Биоинформатика = вычислительная молекулярная биология Почему так сузился смысл термина?

gatcctccatatacaacggtatctccacctcaggtttagatctcaacaacggaaccattg ccgacatgagacagttaggtatcgtcgagagttacaagctaaaacgagcagtagtcagct ctgcatctgaagccgctgaagttctactaagggtggataacatcatccgtgcaagaccaa gaaccgccaatagacaacatatgtaacatatttaggatatacctcgaaaataataaaccg ccacactgtcattattataattagaaacagaacgcaaaaattatccactatataattcaa agacgcgaaaaaaaaagaacaacgcgtcatagaacttttggcaattcgcgtcacaaataa attttggcaacttatgtttcctcttcgagcagtactcgagccctgtctcaagaatgtaat aatacccatcgtaggtatggttaaagatagcatctccacaacctcaaagctccttgccga gagtcgccctcctttgtcgagtaattttcacttttcatatgagaacttattttcttattc tttactctcacatcctgtagtgattgacactgcaacagccaccatcactagaagaacaga acaattacttaatagaaaaattatatcttcctcgaaacgatttcctgcttccaacatcta cgtatatcaagaagcattcacttaccatgacacagcttcagatttcattattgctgacag ctactatatcactactccatctagtagtggccacgccctatgaggcatatcctatcggaa aacaataccccccagtggcaagagtcaatgaatcgtttacatttcaaatttccaatgata cctataaatcgtctgtagacaagacagctcaaataacatacaattgcttcgacttaccga gctggctttcgtttgactctagttctagaacgttctcaggtgaaccttcttctgacttac tatctgatgcgaacaccacgttgtatttcaatgtaatactcgagggtacggactctgccg acagcacgtctttgaacaatacataccaatttgttgttacaaaccgtccatccatctcgc tatcgtcagatttcaatctattggcgttgttaaaaaactatggttatactaacggcaaaa acgctctgaaactagatcctaatgaagtcttcaacgtgacttttgaccgttcaatgttca ctaacgaagaatccattgtgtcgtattacggacgttctcagttgtataatgcgccgttac ccaattggctgttcttcgattctggcgagttgaagtttactgggacggcaccggtgataa actcggcgattgctccagaaacaagctacagttttgtcatcatcgctacagacattgaag gattttctgccgttgaggtagaattcgaattagtcatcggggctcaccagttaactacct ctattcaaaatagtttgataatcaacgttactgacacaggtaacgtttcatatgacttac ctctaaactatgtttatctcgatgacgatcctatttcttctgataaattgggttctataa

В конце 1970-х годов был изобретён относительно быстрый и дешёвый метод экспериментального определения последовательности оснований в ДНК Организм ДНК «в пробирке»Последовательность выделение секвенирование...TGCCACAAATCAC...

Для хранения все возрастающей информации о последовательностях ДНК в 1982 году был основан GenBank GenBank — хранилище последовательностей нуклеиновых кислот в виде компьютерных файлов Объем GenBank’а: 1982: букв в 606 последовательностях 1992: букв в последовательностях 2002: букв в последовательностях 2004: букв в последовательностях 2005: букв в последовательностях (из ~ организмов) Размер файлов — 196 Gb

Пионеры биоинформатики Лайнус Полинг 1962 Zuckerkandl, E., and L. Pauling Molecular disease, evolution, and genic heterogeneity. Horizons in Biochemistry, Academic Press, New York, Zuckerkandl, E., and L. Pauling Evolutionary divergence and convergence in proteins. Evolving Genes and Proteins, Academic Press, New York, Анализ аминокислотных последовательностей глобинов нескольких позвоночных Гипотеза молекулярных часов

Пионеры биоинформатики Маргарет Дейхофф Однобуквенный код аминокислот A,C,D,E,F,G,H… Матрицы аминокислотных замен PAM (Point Accepted Mutation) 1965 Атлас последовательностей белков и их структур (1965)

Первый “банк данных” Атлас белковых последовательностей и их структур Первая версия атласа содержала описание 65 (!) последовательностей белков

Банки данных Архивные (примеры: PDB, GenBank) за содержание каждой записи отвечает её автор-экспериментатор Курируемые за содержание записей отвечают специальные люди — кураторы Автоматические записи генерируются компьютерными программами

Банк данных Swiss-Prot 1986 Swiss-Prot – база знаний о белковых последовательностях Курируемая база данных “Золотой стандарт” аннотации

Банк данных Swiss-Prot Амос Байрох Руководитель группы Swiss-Prot в Швейцарском Институте Биоинформатики С 1987 поддерживается в сотрудничестве между Swiss Institute of Bioinformatics (SIB) European Bioinformatics Institute (EBI)

Банк данных Swiss-Prot Статистика роста количества документов Текущий релиз 48.9 (24 января 2006) содержит документов

Банк данных TrEMBL Формальная трансляция всех кодирующих нуклеотидных последовательностей из банка EMBL Автоматическая классификация и аннотация TrEMBL (Translated EMBL) Текущий релиз 31.9 (24 января 2006) содержит документа

Тенденция объединения 2002

Банк данных UniProt UniProt (Universal Protein Resource) UniProt Knowlegebase – SwissProt+TrEMBL UniProt Archive – UniParc UniProt Reference – UniRef

~ последовательностей DDBJEMBL GenBank ttttacctctttttagtgatattgtgatatagagcaaaaatcccgacattgtgtcgggattgtttttaaactcttgttgattttaatttttcaatcgcttctttattaaagaagtagtgtgtgcc acaacactcacattgcatatcaatacggcctttatgttcggctaatatttcgtcaatttcttcatcagagatgagcagtagatgcagaactagaacgctcagcagagcagccaca gaaaaattgtacatcttgtgctggataaagattaacggtttcttcgtgatataaacgataggagtaactcttctgcagggagaccaaataattcttcatcttttactgttgctgcgagc gtagttaaatgctcaaaatcttctggtgtaccagaaccatcaggcataatttgtaataacatacctgctgccactggcttgccttcatattctccagtacgaataattaattgagtttg aagactcatattttcagtgaagtttcgatcgcccttaggaggggccgcgctttctctttcaa компьютерный поиск гена, трансляция и компьютерная аннотация UniRef (UniProt non-redundant Reference databases) PIR-PSD UniParc (UniProt Archive)  последовательностей Экспертиза Базы данных научной литературы

Соотношение числа белков, представленных в разных банках Последовательностей во много раз больше, чем структур! Большинство последовательностей не аннотированы!

Документ банка данных Swiss-Prot Описание документа: идентификатор, имя, дата создания и модификации Аннотация последовательности Последовательность

Основные поля записи SwissProt ID AC DE OS OC И сама последовательность, конечно.