Вход Блог
Строительство и ремонт
Репетиторы
Красота
Фрилансеры
Разные специалисты
Уход за животными
Тренеры
Автоинструкторы

Программисты — удалённая работа в Москве

Дата: 2026-02-03
Детали
Регион
Москва
Занятость
дистанционно
Стоимость
договорная
Дата публикации
2026-02-03
Описание
Data Science. Настройка. ТЗ: Создание персональной RAG-системы для анализа большого архива текстов Кратко о проекте: Нужно создать персональную систему на основе RAG (Retrieval-Augmented Generation) для работы с моим архивом исследовательских текстов. Система должна позволять задавать вопросы на естественном языке и получать точные ответы, основанные исключительно на содержимом моих документов, без необходимости их ручной загрузки для каждого запроса. 1. Детальное описание проблемы (бэкграунд) У меня есть собрание авторских текстов (статьи) общим объёмом от 10 000 до 100 000+ слов. В настоящее время я пытаюсь работать с ними через чат DeepSeek, что приводит к следующим проблемам: • Невозможность работы со всем архивом: Лимит контекста чата не позволяет загружать все тексты одновременно. • Ненадёжность ссылок: Публикация текстов в откытых ресурсах и попытка загрузки по ссылкам приводит к искажениям и неполной передаче текста. • Непрактичность ручной загрузки: Копировать большие тексты вручную для каждого нового диалога — нереалистично. Цель: Преодолеть эти ограничения, перенести работу в специализированную систему, где весь архив будет проиндексирован и доступен для интеллектуального поиска. 2. Что нужно сделать (Конкретные задачи) Исполнителю необходимо разработать и развернуть рабочее решение, которое включает: 1. Загрузку и индексацию архива: o Приём предоставленных текстовых файлов (форматы: .txt, .pdf, .docx). o Настройку процесса разбивки текстов на оптимальные фрагменты (chunking) с учётом смысловой целостности. o Преобразование текстов в векторные эмбеддинги и сохранение в векторную базу данных. 2. Разработку ядра RAG-системы: o Создание модуля, который по текстовому запросу пользователя находит в векторной БД наиболее релевантные фрагменты из всего архива. o Интеграцию языковой модели (DeepSeek через официальный API) для генерации ответов на основе найденных фрагментов. o Настройка промта (инструкции) для LLM, чтобы ответы были точными, ссылались на исходные тексты и избегали «галлюцинаций». Т.З. писал ИИ. Могу в чем то ошибаться, но суть вопроса, надеюсь раскрыл.
Похожие заказы

Разработка на Python

дистанционно
договорная
Data Science. Разработка с нуля, тестирование, настройка. 1 Обучить нейросеть распознавать типы устройств по набору фото (2-5 штук). Нейросеть должна работать локально (без доступа к сети интернет) 2 Разработать API (на выделенном Linux сервере) которое на вход будет принимать набор фото, а возвращать тип, марку, заводской номер устройства. Датасет для обучения, тестирования и приёмки работ есть. Количество типов устройств 18, марок 600 Просьба продемонстрировать релевантный опыт обучения нейросетей.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Разработка с нуля, тестирование, настройка, доработка существующего продукта, Другое.
Москва Фрилансеры

Data scientist

дистанционно
договорная
репетитор.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Доработка существующего продукта. Нужен разбор уже написанной методики - не разработка с нуля. Контекст: продукт для управления ценой в гостиничном бизнесе. Написана методика оценки эластичности спроса по цене и протокол её доказательства: определение оцениваемой величины, аудит идентификации, счётная регрессия с логарифмической связью и экспозицией, цензурирование при распродаже, учёт замещения между датами, иерархическое объединение, расчёт мощности, негативные контроли, предрегистрация. Кода модели пока нет, данные не накоплены. Задача - прочитать документ (около 18 страниц) и дать вердикт по пунктам: 1. Корректна ли стратегия идентификации и достаточно ли рандомизации в предложенном виде. 2. Верен ли расчёт мощности и разумны ли допущения, из которых он выведен. 3. Чего не хватает в протоколе проверок и что может дать смещённую оценку. 4. Где методика обещает больше, чем позволяет дизайн. Формат: удалённо, разовая работа, 1-2 недели. Возможна последующая консультация на этапе реализации. Требования: практический опыт причинного вывода на наблюдательных данных, дизайн экспериментов, счётные модели (Пуассон или отрицательное биномиальное, экспозиция, сверхрассеяние), расчёт мощности. Плюсом - ценообразование, ритейл, revenue management.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Настройка. Стоит серверная стойка, локальное подключение по ethernet кабелю между оконечниками есть, отсутствуют жесткие диски в стойке. Купил 4 жестких на 1тб, необходимо наверное накатить необходимую версию винды на жесткие, правильно их установить и настроить сам сервер.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Разработка с нуля, настройка. Из амо срм выгрузить необходимые данные и подгрузить в яндекс даталенз для аналитики, отслеживания выручки, конверсии и тд. Профиль- медицина.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Настройка. Ищу специалиста работающего с Knime. Необходима помощь в установке и объяснение как им пользоваться.
Кемерово Фрилансеры