Привет, я Андрей @ab0xa, bi / de / java dev
Анализ данных и визуализация, интересные ссылки, вакансии, уроки, юмор) и личный опыт
Стек технологий Python, Java, SQL, Tableau, Knime, Yandex.Облако, Yandex DataLens
Привет, я Андрей @ab0xa, bi / de / java dev
Анализ данных и визуализация, интересные ссылки, вакансии, уроки, юмор) и личный опыт
Стек технологий Python, Java, SQL, Tableau, Knime, Yandex.Облако, Yandex DataLens
Обычно аналитик приходит в готовый стек. А если стека нет?
В курсах и руководствах обычно предполагается, что дашборды уже есть, данные уже прилетают в хранилище, метрики уже согласованы. В реальности старший аналитик чаще получает противоположное: систему с историей, где логика размазана по коду, аналитического слоя нет вовсе, а продакт хочет цифру ко вторнику.
karpovꓸcourses собрали бесплатный интенсив «Как аналитику разобраться в сложном домене и влиять на бизнес-решения» — как раз про такую отправную точку.
Разбор на кейсе Авиасейлс: технология комбинирования билетов, метрика на 10% ниже OKR (цели и ключевые результаты), понимания про причину — нет.
Разберем весь путь: как заходить в чужой домен, добывать данные, строить инструменты и в итоге двигать бизнес-показатель.
На интенсиве:
- метод входа в незнакомую систему;
- декомпозиция сложной метрики;
- перевод сырых данных в бизнес-инсайты;
- инструменты, которые снимают поток ad hoc-запросов; — как связать аналитику с OKR.
Ведет Илья Шведов, старший аналитик Авиасейлс.
За регистрацию сразу приходит пак: путь аналитика от младшего специалиста к старшему, подборка по А/Б-тестам, материалы по статистике от Анатолия Карпова, «Нейросети для аналитика данных» и карта компетенций в DS (науке о данных).
Регистрируйтесь по ссылке — https://clc.to/erid_2W5zFH6RrTj
Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFH6RrTj
Lakehouse для аналитиков и инженеров данных
Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
• Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
Кто мы: R&D-центр Devhands, наш канал.
Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B),
ex: VK Tech, М.Видео, Эльдорадо
🗓 Старт курса: 27 августа
Изучить программу и записаться можно здесь.
Ждём вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
Пять базированных вещей для тех, кто вкатывается в аналитику
Часть 2
Первая часть здесь, и там мы остановились на:
А что менеджеру-то отвечать, если он спросит про падение метрик?
4️⃣Умение объяснить результат
Возможно теперь это умение конкурировать с AI за экспертизу. Но еще это умение не городить сложные модели, которые никому не нужны. Давайте не будем строить космолеты с катбустом из 50 фич, когда достаточно просто таблички со скорами.
А давайте теперь представим, что бизнес просто сходил в ChatGPT и спросил что ему нужно напрямую. Ему отвечают быстро, красиво, правильно и уверенно. Почему бизнесу должно ждать именно нас?
А вот почему: потому что мы знаем контекст, данные, ограничения и подводные камни конкретно этого бизнеса и конкретно этих гипотез. Мы можем задать правильный вопрос до того, как начать строить модель. А ллмки пока работают с тем, что им дали. Наша же задача работать с тем, что происходит в реальности и возможно это не перенесешь в контекст модельки.
Умение слушать бизнес и переводить его вопросы в задачи AI не заменит еще достаточно долго
5️⃣Воспроизводимость
Мы обучили модель, получили 0.95 ROC-AUC. Через неделю пересчитали и стало 0.85. А в чем проблема? Ллмка говорит, что random_seed не был зафиксирован, а еще версия нампая обновилась.
А теперь добавим реальный рандом в пайплайн - промпты, апишки, генерацию рандома и фичей через модель. становится ли воспроизводимость сложнее? А что если модельку убрали на бэкенде провайдера, а потом через несколько недель вернули. А наш пайплайн уже все - дает другой результат. Мне кажется, что те люди, которые умеют строить воспроизводимые пайплайны с эйяем внутри будут иметь спрос сильно больше, чем на вес золота
Скажу базу - AI мощный инструмент в руках того, кто понимает суть и глубину вопроса
С другой стороны уже нет столько времени изучать большие материалы в сильно динамичном мире. Забудьте про roadmap'ы с миллиардами курсов. Берите проблемы и вопросы, которые вас реально беспокоят и на них практикуйте SQL, статистику, питоны. Сделайте из этого реальный проект, пиште код, который будет работает одинаково. Ну и собирайте команду единомышленников, чтобы взаимодействовать друг с другом.
Согласны? Надеюсь никого не напугал?
Кстати, можем попробовать собрать мини-комьюнити с таким движняком - с вас эмодзи или стикеры в комментариях. А с меня время на подумать
#ml #career #novice #softskills #llm #agents
Пять базированных вещей для тех, кто вкатывается в аналитику
Часть 1
Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде прохождения курсов, ну и скорее всего перед собесами выучены одни и те же источники с ответами на 100 самых известных вопросов. А потом откликаются на непростые вакансии с узкой направленностью и на первых же вопросах идет столкновение с бурмалдой реальностью.
Я решил поделиться с вами пятью вадными пунктами, без которых просто не выжить в этих датасаенсах, когда начнешь работать. Кстати, в последнее время наблюдается новый уровень этого явления, когда вообще нет желания что-то ботать, ведь AI сделает все лучше:
Зачем мне SQL/статистика/питончик - у меня есть ChatGPT, он все напишет
1️⃣SQL
Я уже писал об этом, и реально рекомендую начинать именно с SQL. Больше половины рабочего времени уходит на подготовку, обработку данных и приведение их в нормальный вид. SELECT, WHERE, JOIN, GROUP BY, оконные функции - это обычный базовый минимум.
И пусть ChatGPT напишет вам запрос и возможно он заработает с первого раза. Только как вы поймете, что он написал его правильно, если сами не знаете SQL? Я по долгу своей работы неоднократно видел кейсы, когда скармливаешь LLM весь контекст задачи, раздаешь тулы, доступы, апишки, и возможно даже на выходе получаю красивый запрос. Но блин есть вероятность, что он либо не отработает, либо выдаст не тот результат. Допустим из-за неправильного джойна или не выбора не той колонки из 5-ти похожих.
Ну и прикиньте, если кто-то из нас спокойно понес бы этот результат бизнесу, потому что проверить не хватило экспертизы
2️⃣Статистика
Описательная статистика, выборки, доверительные интервалы является еще одной из баз аналитика. Скорее всего на реальном проекте придется спорить с бизнесом о том, значима ли разница в метриках, и стоить ли катить серый тест. Я уверен, что аргументов у вас будет больше с развитым знанием статистики.
Проблема сейчас кстати есть и с другой стороны - теперь бизнес приходит с распечаткой из Клода и говорит: "Смотри бро, модель говорит, что разница значима, катим тест". Ну и в таких случаях точно нужно уметь объяснить, почему ллмка здесь могла ошибиться из-за отсутствия правильного контекста, и конечно предложить нормальный статистический тест.
Пока AI не сможет собирать весь контекст, он не заменит языка выводов в том смысле, в котором знаем его мы
3️⃣Реальный проект
Напомню, что в последнее время требования растут. При входе в профессию уже не хватит просто знаний Python и SQL. Нужен реальный и работающий проект, сделанный полноценно от формулировки задачи до крутых метрик и выводов. И скорее всего уже не Kaggle (только если не планируется там лутать медали). Реальный имеется в виду такой, где мы сами собирали данные, чистили пропуски, работали с дубликатами, обучали модель и тестировали гипотезы.
Хорошая новость - AI реально может ускорить рутину и написать весь этот код с чисткой данных, бейздайнами и пайплайнами, уже и предложит идеи по фичам. Плохая новость - если ты бездумно использовать ллмки как костыль с первого дня, ты возможно мы не на 100% погрузимся вглубь того, что сейчас происходит внутри проекта.
Как можно управлять процессом, которого не понимаешь? Что делать, если все поломалось и данных нет? Какой вариант правильный из трех предложенных агентом?
А что менеджеру-то отвечать, если он спросит про падение метрик?
Продолжение завтра...
А пока накидайте ваших мыслей в комментарии, что же там может быть еще?
#ml #career #novice #softskills #llm #agents
«Это разве аналитика?» - канал из категории «Бизнес», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 4 691 подписчик суммарно в Telegram и MAX. За последние 24 дня в истории MaxGate учтено 11 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.