DataScience Lab
[] Материалы Докладчики Программа Спонсоры Контакты En Ru DataScience Lab (exAI&BigDataLab) IV конференция по практическому применению науки о данных 13 Мая 2017 | Одесса Data Science Lab - это ежегодная техническая конференция, которая объединяет исследователей, инженеров и разработчиков, связанных с Data Science для обмена опытом и обсуждения актуальных тем в области машинного обучения, обработки естественного языка, распознавания образов и других аспектов анализа данных. Темы докладов раскрывают вопросы от практического внедрения результатов исследований до самых последних теоретических разработок. Докладчики Виктор Сарапин CEO at V.I.Tech 20 лет в индустрии, начинал с программирования на С++, занимался проектировкой и разработкой распределённых приложений и матмоделированием, пропагандирую целостный взгляд на задачи сосуществования людей и машин и замечательных штук, который происходят в современной ИТ-индустрии. Интересуюсь ИИ и самоорганизующимися системами, параллельными вычислениями, языковыми разработками (доменные языки особо интересны), управлением знаниями. Из предметных областей - здравоохранение и биотек. Сергей Шельпук Head of Data Science Office at Eleks Энтузиаст искусственного интеллекта и анализа данных, руководитель data science office в нескольких компаниях, лектор программы компьютерных наук УКУ Степан Пушкарев GM (Kazan) at Provectus / CTO at Hydrosphere.io General Manager Big Data Provectus. Он построил экспертизу и линейку консалтингового бизнеса по анализу больших данных. Также Степан руководит разработкой и продуктовым видением в Hydrosphere.io. Терпиль Евгений Data Scientists at YouScan Data Scientists в YouScan. В основном работаю с различными задачами классификации и кластеризации текстов. Также являюсь аспирантом в «Институте Прикладного Системного Анализа» НТУУ «КПИ». Основное направление исследования анализ социальных сетей и моделирования общественного мнения. Алексей Кравченко Senior Data Scientist at Zoral Labs Специалист по машинному обучению с многолетним опытом работы в области дистанционного зондирования Земли, обработки изображений и ГИС. Кандидат технических наук. Juantomás García Data Solutions Manager, OpenSistemas Дмитрий Белевцов Techlead at IBDI Занимаюсь обработкой данных и немного data science. В свободное время занимаюсь ML алгоритмами для обработки речи и (с недавнего времени) deep learning. Александр Саенко Software Engineer at SoftServe/CISCO Кандидат технических наук, занимается вопросами применения машинного обучения для оптимизации сетей мобильной связи. Имеет более 10 лет опыта работы в ведущих телекоммуникационных компаниях (UMC, MTS Ukraine, CISCO). Дмитрий Новицкий Старший научный сотрудник в ИПММС НАНУ Специалист по искусственному интеллекту, машинному обучению, нейронным сетям и др. Кандидат физ-мат наук, имеет опыт работы во Франции, США и др. Павел Худан NLP Engineer at YouScan NLP инженер с опытом в автоматизации лингвистического анализа, краткого изложения текстов, классификации и кластеризации коротких текстов. Интересуюсь морфологией и синтаксисом, методами векторного представления слов и смыслов, ML методами в NLP. Виталий Кошура Software Developer at Lohika Инженер с опытом 5+ лет коммерческой и 8+ лет суммарной разработки программного обеспечения с использованием технологий: C/C++, C#, Delphi, OpenCV, MSSQL, MySQL, Windows, Linux Сертифицированный разработчик на C#. Мамед Халилов CEO & Founder at Morbax HR С 2010 управляю аутсорс компаниями в области веб разработки. В последние два года перехожу на сторону продуктовой компании и создания своих проектов. Повышаю экспертизу в нишевой сфрере HR software development с применением Deep Learning & Machine Learning. Ольга Романюк Data Scientist at Eleks Участвовала в нескольких проектах, связанных с компьютерным зрением, которые использовали различные типи глубоких нейронных сетей, написанных на TensorFlow. Дарина Перемот ML Engineer at SynergyOne Внедряю машинное обучение в AdTech стартапе. Ольга Татаринцева Data Scientist at Eleks Изучала онтологический инжиниринг в рамках работы над кандидатской диссертацией. Принимала участие в международной исследовательской программе в University of Huddersfield, UK. Maksym Bevza Research Engineer at Grammarly Юрий Гуц Machine Learning Engineer at DataRobot Специалист с 10-летним стажем в индустрии и разносторонним опытом Data Science, ML, R&D и архитектуры ПО. Разрабатываю платформу DataRobot. Преподаватель CS@UCU, Kyivstar Big Data School, LITS. Константин Герасименко CEO at Easyolap ИТ Архитектор Юрий Пащенко Research Engineer at Ring Labs Юрий получил степень магистра факультета Прикладной математики НТУУ КПИ в 2014 году. Профессиональные интересы связаны с глубокими свёрточными сетями, распознаванием лиц, обнаружением объектов, машинным обучением. Выступал с докладами на многих конференциях, включая AI Ukraine, Lviv IT Arena, Kharkov AI Club, IT Trends. Программа DataScience Lab 2017 Время; Поток 1; Поток 2 09:30 - 10:00; Регистрация. Welcome-coffee ; 10:00 - 10:45; From bag of texts to bag of clusters Терпиль Евгений / Павел Худан (Data Scientists / NLP Engineer at YouScan) Мы рассмотрим современные подходы к кластеризации текстов и их визуализации. Начиная от классического K-means на TF-IDF и заканчивая Deep Learning репрезентациями текстов. В качестве практического примера, мы проанализируем набор сообщений из соц. сетей и попробуем найти основные темы обсуждения.; Kappa Architecture: How to implement a real-time streaming data analytics engine Juantomás García (Data Solutions Manager at OpenSistemas, Madrid, Spain) We will have an introduction of what is the kappa architecture vs lambda architecture. We will see how kappa architecture is a good solution to implement solutions in (almost) real time when we need to analyze data in streaming. We will show in a case of real use: how architecture is designed, how pipelines are organized and how data scientists use it. We will review the most used technologies to implement it from apache Kafka + spark using Scala to new tools like apache beam / google dataflow. Язык доклада: английский 10:50 - 11:35 ; Cервинг моделей, построенных на больших данных с помощью Apache Spark Степан Пушкарев (GM (Kazan) at Provectus / CTO at Hydrosphere.io) После подготовки данных и обучения моделей на больших данных с использованием Apache Spark встает вопрос о том, как использовать обученные модели в реальных приложениях. Помимо модели важно не забывать про весь пайплайн пре-процессинга данных, который должен попасть в продакшн в том виде, в котором его спроектировал и реализовал дата саентист. Такие решения, как PMML/PFA, основанные на экспорте/импорте модели и алгоритма имеют очевидные недостатки и ограничения. В данном докладе мы предложим альтернативное решение, которое упрощает процесс использования моделей и пайплайнов в реальных боевых приложениях. ; Коррекция геометрических искажений оптических спутниковых снимков Алексей Кравченко (Senior Data Scientist at Zoral Labs) Мы рассмотрим разнообразие существующих спутниковых данных и способов их применения в сельском и лесном хозяйстве, картографировании земной поверхности. Далее сфокусируемся на задаче геометрической коррекции снимков как первом шаге процесса обработки спутниковых данных, включая геопривязку снимков, регистрацию изображений, субпиксельную идентификацию контрольных точек, совмещение каналов. Также расскажем о некоторых интересных и неожиданных подходах к определению ориентации и jitter спутников и построению маски облачности. 11:35 - 12:00; Кофе-брейк ; 12:00 - 12:45; Сходство пациентов: вычистка дубликатов и предсказание пропущенных диагнозов Виктор Сарапин (CEO at V.I.Tech) Как эффективно определять дубликаты на десятках миллионов пациентов, и как определять пропущенные диагнозы и лечебные действия.; Высокопроизводительные вычислительные возможности для систем анализа данных Михаил Федосеев ( Архитектор инфраструктурных решений, LanTec) В докладе мы поговорим о hardware стороне систем анализа данных для случаев построения приватных облаков или локальных высокопроизводительных вычислительных кластеров. Рассмотрим какие технологии и комплексные решения от компании Hewlett Packard Enterprise позволяют ускорить процесс анализа данных. Это не только зарекомендовавшие в своей области лучшие в своем сегменте сервера линейки HPE Apollo, а так же высокоскоростные сетевые коммутаторы HPE, но и дополнительные вспомогательные элементы решения, такие как мощные графические карты NVIDIA и хост-процессоры Xeon Phi. Так же будет рассмотрен стек HPE Core HPC Software Stack, который позволяет администраторам контролировать использование ресурсов системы. 12:50 - 13:35; Обзор методов детекции лиц на изображение Юрий Пащенко ( Research Engineer, Ring Labs) В данном докладе мы предлагаем обзор наиболее новых и популярных методов обнаружения лиц, таких как Viola-Jones, Faster-RCNN, MTCCN и прочих. Мы обсудим основные критерии оценки качества алгоритма а также базы, включая FDDB, WIDER, IJB-A.; BioVec: Word2Vec в задачах анализа геномных данных и биоинформатики Дмитрий Новицкий (Старший научный сотрудник в ИПММС НАНУ) Этот доклад посвящен bioVec: применению технологии word2vec в задачах биоинфоматики. Сначала мы напомним как работает Word2vec и аналогичные ему методы Word Embedding. Затем расскажем об особенностях Word2vec в применении к геномным последовательностям-- основному виду данных в биоинформатике. Как обучать bioVec, и применять эту технологию к задачам классификации белков, предсказания их функции и др. В заключении мы продемонстрируем примеры кода для обучения и использования bioVec. 13:35 - 15:00; Обед ; 15:00 - 15:45; Оптимизация гиперпараметров машинного обучения при помощи Байесовской оптимизации Максим Бевза (Research Engineer at Grammarly) Все алгоритмы машинного обучения нуждаются в настройке (тьюнинге). Часто мы используем Grid Search или Randomized Search или нашу интуицию для подбора гиперпараметров. Байесовская оптимизиция поможет нам направить Randomized Search в те места, которые наиболее перспективны, так, чтобы тот же (или лучший) результат мы получили за меньшее количество итераций.; Data Sciences и Big Data в Телекоме Александр Саенко (Software Engineer at SoftServe/CISCO) Александр расскажет о некоторых интересных примерах использования Big Data и Data Science в Телекоме: оптимизация сотовой сети, улучшение клиентского опыта, модели прогнозирования местоположения мобильных устройств, предотвращения оттока абонентов, обнаружение фрода и других. Рассмотрит основные современные подходы к их решению на основе алгоритмов машинного обучения. 15:50 - 16:35; Мониторинг модных трендов с помощью глубокого обучения и TensorFlow Ольга Романюк (Data Scientist at Eleks) В течении последних 8 месяцев мы в Eleks работали над системой отслеживания модных трендов, основанной на глубинной остаточной нейронной сети с тождественным отображением. При тренировке сети мы использовали онлайн увеличение объема данных, а также распараллеливание данных по двум картам GPU. Мы создали эту систему с нуля при помощи TensorFlow. В презентации я расскажу о практической стороне проекта, нюансах реализации и подводных камнях, с которыми мы столкнулись во время работы. Язык доклада: украинский. ; Как знать всё о покупателях (или почти всё)? Дарина Перемот (ML Engineer at SynergyOne) Раскроем собственный ответ на вопрос "Чего же хочет покупатель?". Поделимся результатами исследований транзакций и расскажем, есть ли у вас домашний питомец. А так же, продемонстрируем, как машинное обучение уже сейчас помогает узнавать вас ближе. 16:35 - 17:00; Кофе-брейк ; 17:00 - 17:45; Кто здесь? Автоматическая разметка спикеров на телефонных разговорах Юрий Гуц (Machine Learning Engineer, DataRobot) Автоматическая аннотация спикеров — интересная задача в обработке мультимедиа-данных. Нам нужно ответить на вопрос "Кто говорит когда?", не зная ничего о количестве и личности спикеров, присутствующих на записи. В этом докладе мы рассмотрим работающие методы для аннотации спикеров на телефонных разговорах.; Графические вероятностные модели для принятия решений в проектном управлении Ольга Татаринцева (Data Scientist at Eleks) Как часто вам приходится принимать решения, используя знания в определенной предметной области? На сколько хороши такие решения? А теперь представьте, что вы собрали знания лучших экспертов в предметной области. Похоже, что ваши решения, основанные на этих знаниях, будут куда более взвешенными, не так ли? Мы будем говорить о системе ProjectHealth, которая была построена на основе опыта лучших экспертов в проектном управлении в компании Eleks. Для реализации поставленной задачи была использована графовая вероятностная модель, а именно байесовская сеть, имплементированная на Python. За время работы над проектом мы прошли шаги от извлечения требований, поиска данных и построения модели с нуля до реализации BI дашборда с возможностью углубиться в детали, доходя до сырых данных. Сейчас ProjectHealth экономит большое количество времени для топ менеджмента и ресурсов компании, так как мониторит состояние бизнеса в малейших деталях ежедневно и делает это как настоящий эксперт. 17:55 - 19:00; БЛИЦ-ДОКЛАДЫ: Кейсы использования FlyElephant для DataScience задач. Dmitry Spodarets (CEO & Founder, FlyElephant) В рамках этого блиц-доклада мы познакомимся на конкретных примерах с основными возможностями платформы FlyElephant для DataScience задач. Мы рассмотрим автоматизацию обучения моделей, создание рабочего окружения в несколько кликов, совместную работу над задачами. Поговорим о варианте использования платформы FlyElephant на облачных и локальных вычислительных ресурсах. Энтерпрайз "из коробки" Сергей Шельпук (Head of Data Science Office at Eleks) ИТ архитектура энтерпрайз уровня для анализа данных из open source компонент Recent deep learning approaches for speech generation Дмитрий Белевцов (Techlead at IBDI) В последние пол года появилось несколько важных моделей на базе глубоких нейронных сетей, способных успешно синтезировать человеческую речь на уровне отдельных сэмплов. Это позволило обойти многие недостатки классических спектральных подходов. В этом докладе я сделаю небольшой обзор архитектур наиболее популярных сетей, таких как Wavenet и SampleRNN. Применение машинного обучения при разработке HR продукта Мамед Халилов (CEO & Founder at Morbax HR) Описание этапов создания продукта с использованием машинного обучения. Начиная от линейных уравнений и заканчивая полносвязной многослойной нейросетью.; Распределенные вычисления: использование BOINC в Data Science Виталий Кошура (Software Developer at Lohika) BOINC - это открытое программное обеспечение для распределенных вычислений. Данный доклад освещает использование приложения BOINC в различных областях науки, которые связаны с обработкой огромных массивов данных, на примере текущих активных исследовательских проектов. Магистерская программа "Data Science" в УКУ Орест Купин (Master's Student at UCU) В этом докладе я расскажу вам о магистерской программе со специализацией в анализе данных в Украинском Католическом Университете. Я расскажу про структуру программы, основные курсы, а также опишу свой опыт как студента УКУ и поговорю об вызовах с которыми мы столкнулись в этом году. Сервис для аналитической обработки огромных объемов структурированных данных Константин Герасименко CEO, Easyolap . 19:00 - 19:15; Закрытие и вручение призов 19:15 - ... ; Афтерпати Организаторы Золотые Спонсоры Серебряный Cпонсор Cпонсоры Партнёры Инфопартнеры Программный комитет DataScience Lab '17 Dmitry Spodarets (Ukraine) CEO & Founder at FlyElephant Founder and CEO at FlyElephant, a lecturer at Odessa National Polytechnic University, and a researcher at the Odessa I.I. Mechnikov National University. Organizer of various international technical conferences in Ukraine. Andrei Lopatenko (USA) Director of Engineering at Recruit Institute of Technology Andrei Lopatenko got PhD Degree in Computer Science from the University of Manchester, UK. He has been developing search, natural language understanding technologies in Google, Apple, Walmart Labs, RIT. Oleksandr Romanko (Canada) Senior Research Analyst, Risk Analytics at IBM Canada; Adjunct Professor at University of Toronto and Ukrainian Catholic University Александр работает в отрасли риск-аналитики, бизнес-аналитики, финансового риск-менеджмента и информационных технологий. Он является автором более 20 статей в международных научных журналах и глав в нескольких книгах. Sergey Shelpuk (Ukraine) Head of Data Science at Eleks Энтузиаст искусственного интеллекта и анализа данных, руководитель data science office в нескольких компаниях, лектор программы компьютерных наук УКУ. Artem Chernodub (Ukraine) Chief R&D Officer at Clikque Technology Более 10 лет опыта работы с алгоритмами машинного обучения, распознавания изображений, обработки естественного языка и нейронными сетями. Кандидат технических наук, рецензент научного журнала "Neural Networks" (Elsevier). Контакты Дмитрий Сподарец Программа и спонсоры d.spodarets@flyelephant.net +38 (050) 391-28-70 Александра Ковальчук Партнеры, оплата , орг вопросы contact@geekslab.org.ua +38 (093) 347-64-75 Место проведения Impact Hub Odessa ул. Греческая, 1а contact@geekslab.org.ua +38093 347 64 75 Следить за новостями! Подписаться Facebook Twitter VK Youtube Instagram LinkedIn © All Right Reserved. GeeksLab 2017 contact@geekslab.org.ua