Вход Блог
Строительство и ремонт
Репетиторы
Красота
Фрилансеры
Разные специалисты
Уход за животными
Тренеры
Автоинструкторы

Data scientist — удалённая работа в Москве

Дата: 2023-05-31
Детали
Регион
Москва
Занятость
дистанционно
Стоимость
договорная
Дата публикации
2023-05-31
Описание
Выполнить сборный учебный проект по SQL. Описание проекта Вы работаете в стартапе, который продаёт продукты питания. Нужно разобраться, как ведут себя пользователи вашего мобильного приложения. Изучите воронку продаж. Узнайте, как пользователи доходят до покупки. Сколько пользователей доходит до покупки, а сколько — «застревает» на предыдущих шагах? На каких именно После этого исследуйте результаты A/A/B-эксперимента. Дизайнеры захотели поменять шрифты во всём приложении, а менеджеры испугались, что пользователям будет непривычно. Договорились принять решение по результатам A/A/B-теста. Пользователей разбили на 3 группы: 2 контрольные со старыми шрифтами и одну экспериментальную — с новыми. Выясните, какой шрифт лучше Создание двух групп A вместо одной имеет определённые преимущества. Если две контрольные группы окажутся равны, вы можете быть уверены в точности проведенного тестирования. Если же между значениями A и A будут существенные различия, это поможет обнаружить факторы, которые привели к искажению результатов. Сравнение контрольных групп также помогает понять, сколько времени и данных потребуется для дальнейших тестов. В случае общей аналитики и A/A/B-эксперимента работайте с одними и теми же данными. В реальных проектах всегда идут эксперименты. Аналитики исследуют качество работы приложения по общим данным, не учитывая принадлежность пользователей к экспериментам. Описание данных Каждая запись в логе — это действие пользователя, или событие. EventName — название события DeviceIDHash — уникальный идентификатор пользователя EventTimestamp — время события ExpId — номер эксперимента: 246 и 247 — контрольные группы, а 248 — экспериментальн я. Инструкция по выполнению проекта Шаг 1. Откройте файл с данными и изучите общую информацию Путь к файлу: /datasets/logs_exp.csv. Скачать датасет Шаг 2. Подготовьте данные Замените названия столбцов на удобные для вас; Проверьте пропуски и типы данных. Откорректируйте, если нужно; Добавьте столбец даты и времени, а также отдельный столбец дат; Шаг 3. Изучите и проверьте данные Сколько всего событий в логе? Сколько всего пользователей в логе? Сколько в среднем событий приходится на пользователя? Данными за какой период вы располагаете? Найдите максимальную и минимальную дату. Постройте гистограмму по дате и времени. Можно ли быть уверенным, что у вас одинаково полные данные за весь период? Технически в логи новых дней по некоторым пользователям могут «доезжать» события из прошлого — это может «перекашивать данные». Определите, с какого момента данные полные и отбросьте более старые. Данными за какой период времени вы располагаете на самом деле Много ли событий и пользователей вы потеряли, отбросив старые данные? Проверьте, что у вас есть пользователи из всех трёх экспериментальных групп. Шаг 4. Изучите воронку событий Посмотрите, какие события есть в логах, как часто они встречаются. Отсортируйте события по частоте. Посчитайте, сколько пользователей совершали каждое из этих событий. Отсортируйте события по числу пользователей. Посчитайте долю пользователей, которые хоть раз совершали событие. Предположите, в каком порядке происходят события. Все ли они выстраиваются в последовательную цепочку? Их не нужно учитывать при расчёте воронки. По воронке событий посчитайте, какая доля пользователей проходит на следующий шаг воронки (от числа пользователей на предыдущем). То есть для последовательности событий A -> B -> C посчитайте отношение числа пользователей с событием B к количеству пользователей с событием A, а также отношение числа пользователей с событием C к количеству пользователей с событием B. На каком шаге теряете больше всего пользователей? Какая доля пользователей доходит от первого события до оплаты? Шаг 5. Изучите результаты эксперимента Сколько пользователей в каждой экспериментальной группе? Есть 2 контрольные группы для А/А-эксперимента, чтобы проверить корректность всех механизмов и расчётов. Проверьте, находят ли статистические критерии разницу между выборками 246 и 247. Выберите самое популярное событие. Посчитайте число пользователей, совершивших это событие в каждой из контрольных групп. Посчитайте долю пользователей, совершивших это событие. Проверьте, будет ли отличие между группами статистически достоверным. Проделайте то же самое для всех других событий (удобно обернуть проверку в отдельную функцию). Можно ли сказать, что разбиение на группы работает корректно? Аналогично поступите с группой с изменённым шрифтом. Сравните результаты с каждой из контрольных групп в отдельности по каждому событию. Сравните результаты с объединённой контрольной группой. Какие выводы из эксперимента можно сделать? Какой уровень значимости вы выбрали при проверке статистических гипотез выше? Посчитайте, сколько проверок статистических гипотез вы сделали. При уровне значимости 0.1 каждый десятый раз можно получать ложный результат. Какой уровень значимости стоит применить? Если вы хотите изменить его, проделайте предыдущие пункты и проверьте свои выводы. Файл в формате CSV пришлю в вотсап. Напишите, по какой цене выполните эту работу.
Похожие заказы

Программисты

дистанционно
договорная
Data Science. Разработка с нуля, доработка существующего продукта. Ищу Python/LLM-разработчика для создания MVP AI-системы для генеалогических исследований. Система должна анализировать массив архивных документов по человеку и формировать: 1. Генеалогическое досье – связную насыщенную биографию, родственные связи, хронологию, источники и реальные противоречия; 2. Исследовательский слой – анализировать каждый значимый факт и совокупность фактов, выявлять пробелы, формировать обоснованные генеалогические гипотезы и конкретные направления дальнейшего поиска. Например, система должна не просто видеть «место рождения неизвестно», а понимать, что можно установить дальше, зачем это нужно для родословной, какое свидетельство необходимо, где оно может находиться, что изменится при подтверждении/опровержении и куда двигаться при отрицательном результате. Важно сразу проектировать ядро с возможностью дальнейшего развития: - автоматический поиск по архивным каталогам и историческим/генеалогическим онлайн-базам; - работа с фондами, описями и архивными маршрутами; - учёт уже выполненных запросов и отрицательных результатов; - чат по конкретной персоне с опорой на источники; - автоматическая сборка и вёрстка семейной книги из досье, документов, фотографий и древа. На первом этапе всё это реализовывать не требуется — нужен рабочий MVP ядра, но архитектура не должна создавать тупик для дальнейшего развития. Критично: не терять биографически значимую информацию, не смешивать разных людей, сохранять связь выводов с источниками, отличать OCR/описки от реальных противоречий и не превращать предположения LLM в факты.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Есть данные рынков, нужно ежемесячно делать отчеты и презентации по данным.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Test use case for senior data engineer online (time limited 60 min).
Краснодар Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Требуется создать систему автоматического формирования субтитров на основе аудио и видео материалов с использованием технологий искусственного интеллекта. Ориентиры - существующие сервисы speech2text.ru и any2text.ru, но задача - сделать продукт не хуже, а по ряду параметров лучше (расширенный функционал, гибкость, безопасность). Система должна работать как в онлайн-режиме (веб-сервис), так и в офлайн-режиме (локальная программа или self-hosted решение) для работы с конфиденциальными данными. Рассматриваются как готовые решения с доработкой, так и разработка с нуля. Основные функции системы: Автоматическое распознавание речи (ASR): Поддержка русского и иностранных языков (минимум 5–10 популярных). Высокая точность, возможность дообучения под специфическую лексику (историческую, техническую, кинематографическую). Учет контекста через промпты (до 250 слов). Разделение дикторов (Speaker Diarization): Автоматическое определение смены говорящего, присвоение идентификаторов (Мужчина 1, Женщина 1, Группа и т.д.). Возможность ручного переименования спикеров. Распознавание текста на видеоизображении (OCR): Детекция и оцифровка надписей, титров, вывесок. Классификация: диалог, экранный текст, титры. Возможность включать/исключать распознанные надписи в итоговый файл. Машинный перевод (MT): Автоматический перевод субтитров на минимум 14 языков. Сохранение таймкодов и структурной привязки текста (alignment). Учет культурных и исторических особенностей. Встроенный веб-редактор: Двухпанельный режим (оригинал/перевод, черновик/правка). Видеоплеер с покадровой навигацией. Управление таймкодами, разделение/объединение сегментов. Проверка орфографии, поиск и замена. Поддержка версионности (история изменений, откат). Экспорт субтитров: Форматы: SRT, VTT, JSON, XML, DOC/DOCX, ODT, TXT, STL (EBU). Диалоговые листы в Word. Возможность встраивания субтитров в видеофайл. Дополнительно (желательно): Загрузка диалоговых листов (сканы, текст) для повышения точности ASR. Автоматическая проверка соблюдения стандартов субтитрирования (ГОСТ, EBU). Работа в изолированном контуре без доступа в интернет. Технические требования: Использование современных open-source моделей: Whisper (faster-whisper), pyannote.audio, Helsinki-NLP и др. Возможность развертывания на сервере заказчика (on-premise) или в облаке (РФ). Веб-интерфейс (React/Vue + Python/FastAPI/Node.js). Поддержка GPU для ускорения обработки. Передача исходного кода и прав на использование. Ожидаемый результат: Работающий прототип (MVP) с базовым функционалом ASR + экспорт SRT. Полноценная система с редактором, диаризацией, переводом и OCR. Документация (руководство пользователя и администратора). Рассматриваю как отдельных специалистов, так и команды/студии. Как откликнуться: В отклике укажите: Ваш опыт в разработке ASR/ML-систем. Примеры похожих проектов (если есть). Предлагаемый стек технологий. Оценку сроков и стоимости (хотя бы вилку). Готовы ли работать с передачей исходного кода.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Цель задачи: Разработать плагин для FunPay Cardinal, который автоматически изменяет цены товаров на FunPay, получая данные с сайта-донора и управляется через Telegram-бота.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Тестирование.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Разработка с нуля, тестирование, настройка, доработка существующего продукта.
Нижний Новгород Фрилансеры