Logo
TGCATALOG
Catalog Collections Blog
Data Science - собесы

Data Science - собесы

Собесы Data Science.

No ratings
24
09.09.2026
24
09.09.2026
No ratings
24
09.09.2026
Safe redirect via bot
О канале

Собесы Data Science.

Подписчиков 4,915
Тематика Technology
Язык English
Ссылка t.me/easy_ds

We also recommend

Kekaton AI | Voiceover and voice clone
Kekaton AI | Voiceover and voice clone
Bot

AI bot for text-to-speech and voice cloning in Telegram. Create audio using neural network quickly and easily.

Description

Вопросы для собеседований по Data Science.

Latest posts

Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Что такое интерквантили? Это статистическая мера вариативности, которая описывает диапазон центральных 50% данных в наборе. IQR используется для оценки разброса данных и для выявления выбросов. 🚩Понятия 🟠Квартили Первый квартиль (Q1): Значение, ниже которого находится 25% данных. Второй квартиль (Q2): Это медиана, значение, ниже которого находится 50% данных. Третий квартиль (Q3): Значение, ниже которого находится 75% данных. 🟠Интерквартильный размах (IQR) Разница между третьим и первым квартилями. Интерпретация: IQR показывает диапазон, в котором находится центральная половина данных, и помогает понять разброс данных вокруг медианы. IQR = Q3 - Q1 🚩Примеры 🟠Сортировка данных [1, 3, 3, 6, 7, 8, 9, 15, 18, 19] 🟠Вычисление квартилей Первый квартиль (Q1): Среднее значение между вторым и третьим элементом (3 и 6), то есть 4.5. Медиана (Q2): Среднее значение между пятым и шестым элементом (7 и 8), то есть 7.5. Третий квартиль (Q3): Среднее значение между восьмым и девятым элементом (15 и 18), то есть 16.5. Вычисление IQR: IQR = Q3 - Q1 = 16.5 - 4.5 = 12 🚩Использование интерквартильного размаха 🟠Выявление выбросов Значения, которые находятся ниже \(Q1 - 1.5 \times IQR\) или выше \(Q3 + 1.5 \times IQR\), считаются выбросами. 🟠Сравнение распределений IQR может использоваться для сравнения разброса данных в разных наборах или группах. Пример import numpy as np # Данные data = [1, 3, 3, 6, 7, 8, 9, 15, 18, 19] # Вычисление квартилей Q1 = np.percentile(data, 25) Q2 = np.percentile(data, 50) Q3 = np.percentile(data, 75) # Вычисление IQR IQR = Q3 - Q1 print(f"Первый квартиль (Q1): {Q1}") print(f"Медиана (Q2): {Q2}") print(f"Третий квартиль (Q3): {Q3}") print(f"Интерквартильный размах (IQR): {IQR}") # Выявление выбросов lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR print(f"Границы для выбросов: {lower_bound} и {upper_bound}") outliers = [x for x in data if x < lower_bound or x > upper_bound] print(f"Выбросы: {outliers}") Ставь 👍 и забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Что такое градиентный спуск? Градиентный спуск — это метод оптимизации, который используется для нахождения минимального значения функции ошибки модели путём итеративного изменения параметров модели (например, весов). На каждом шаге вычисляется градиент функции ошибки по параметрам, и параметры корректируются в направлении, противоположном градиенту. Шаг изменения регулируется параметром скорости обучения (learning rate). Градиентный спуск эффективен для обучения моделей с большим количеством параметров. Ставь 👍 если знал ответ, 🔥 если нет Забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
Работа в IT — худшая затея для новичка в 2026 году. Мёртвые вакансии, огромная конкуренция, заоблачные требования к кандидатам, ещё и поганый AI. Но всё ли так очевидно? Пока одни бесконечно учат Python, делают очередной пет-проект и ждут, когда станут «достаточно хороши» для первой работы, умные читают Богдана и разбираются, как получить первую работу. Он больше 6 лет работает в бигтехе, прошёл 350+ собеседований и знает: — Почему твоё резюме не даёт откликов — Почему ты не зарабатываешь 400к? — Где искать работу ML-инженеру? И это лишь малая часть. На канале собрана целая база по всем аспектам поиска работы, от резюме до получения оффера и торга. Подписывайся, пока это бесплатно: Ссылка скрыта Реклама ИП Камаев Богдан Эльмарович ИНН 770973951244 erid:CQH36pWzJqVJCbWwemLt6NZsLG2GvZTerG927tW8yZ2ft1
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Когда нужно использовать метод главных компонентов в бизнесе? Метод главных компонентов (Principal Component Analysis, PCA) используется в бизнесе для уменьшения размерности данных, что позволяет легче анализировать и визуализировать большие наборы данных, а также выявлять скрытые структуры и взаимосвязи между переменными. 🚩Когда использовать PCA 🟠Большие наборы данных Когда у вас есть данные с большим количеством переменных (столбцов), и они могут содержать избыточную информацию. Пример: В маркетинговом исследовании у вас может быть множество переменных, таких как возраст, доход, покупательские привычки, предпочтения и т.д. 🟠Проблемы многоколлинеарности Когда переменные сильно коррелируют друг с другом, что может затруднить анализ. Пример: В финансовом анализе цены на различные активы могут быть сильно связаны друг с другом. 🟠Упрощение визуализации Когда нужно визуализировать данные с множеством измерений на двумерных или трехмерных графиках для более простого понимания. Пример: Анализ клиентов на основе различных демографических и поведенческих параметров. 🚩Зачем использовать PCA 🟠Уменьшение размерности PCA уменьшает количество переменных, сохраняя при этом как можно больше информации. Пример: Из набора данных с 100 переменных можно выделить 2-3 главных компонента, которые объясняют основную вариацию в данных. 🟠Улучшение производительности моделей Меньшее количество переменных может уменьшить время обучения моделей машинного обучения и улучшить их производительность. Пример: В прогнозировании спроса на продукцию можно использовать PCA для предварительной обработки данных, чтобы улучшить точность модели. 🟠Удаление шума PCA помогает устранить случайные шумы и незначимые переменные, фокусируясь на важнейших компонентах данных. Пример: В анализе рынка ценных бумаг это может помочь сосредоточиться на основных трендах, а не на случайных колебаниях. 🚩Как это используется 🟠Предобработка данных Перед применением PCA необходимо стандартизировать данные (например, с помощью Z-оценки), чтобы каждая переменная имела одинаковый вес. from sklearn.preprocessing import StandardScaler from sklearn.decomposition import PCA import pandas as pd # Загрузка данных data = pd.read_csv('data.csv') # Стандартизация данных scaler = StandardScaler() scaled_data = scaler.fit_transform(data) # Применение PCA pca = PCA(n_components=2) # Уменьшение до 2 компонент principal_components = pca.fit_transform(scaled_data) # Преобразование обратно в DataFrame pca_df = pd.DataFrame(data=principal_components, columns=['PC1', 'PC2']) 🟠Интерпретация результатов После применения PCA, нужно интерпретировать главные компоненты и их вклад в общую вариацию. Пример: Визуализация двух главных компонент может показать кластеры клиентов с различными характеристиками. Ставь 👍 и забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Как решить задачу, где присутствует одновременно два target – один categorical, другой continuous? Используются модели multi-output, которые обучаются на несколько целевых переменных, например, через отдельные выходные слои в нейросети. Ставь 👍 если знал ответ, 🔥 если нет Забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 В чем заключается проблема овер фитинг? Проблема переобучения (overfitting) заключается в том, что модель машинного обучения слишком хорошо подстраивается под обучающие данные, включая их шум и случайные колебания, что приводит к плохой обобщающей способности на новых, невидимых данных. Переобученная модель имеет высокую точность на обучающих данных, но плохо работает на тестовых или реальных данных. 🚩Причины переобучения 🟠Слишком сложная модель Модель имеет слишком много параметров относительно объема данных. Например, глубокая нейронная сеть с множеством слоев и узлов. 🟠Малый объем данных Недостаточно данных для обучения модели, что приводит к тому, что модель запоминает отдельные примеры вместо выявления общих закономерностей. 🟠Шумные данные Наличие шума или выбросов в данных, которые модель начинает интерпретировать как важные закономерности. 🚩Признаки переобучения 🟠Высокая точность на обучающих данных и низкая на тестовых данных Если модель показывает очень высокую точность на данных, на которых она обучалась, и низкую точность на новых данных, это явный признак переобучения. 🟠Сложные модели с высокими коэффициентами Модель может иметь высокие значения коэффициентов, что указывает на сильное подстраивание под обучающие данные. 🚩Методы предотвращения переобучения 🟠Разделение данных на тренировочный и тестовый наборы Использование тренировочного набора для обучения модели и тестового набора для оценки ее обобщающей способности. 🟠Кросс-валидация Разделение данных на несколько частей и использование разных частей для обучения и тестирования в нескольких итерациях. 🟠Регуляризация Введение штрафов за сложные модели. Например, L1 и L2 регуляризация уменьшают значения коэффициентов модели. 🟠Снижение сложности модели Использование менее сложных моделей с меньшим количеством параметров. 🟠Сбор большего объема данных Увеличение объема обучающих данных помогает модели лучше выявлять общие закономерности. 🟠Прерывание обучения (Early Stopping) Остановка обучения модели, когда ошибка на валидационном наборе данных начинает увеличиваться. 🟠Аугментация данных Создание дополнительных данных путем их модификации (например, поворот, масштабирование изображений), что помогает модели обобщать лучше. from sklearn.linear_model import Ridge from sklearn.model_selection import train_test_split from sklearn.metrics import mean_squared_error # Пример данных X = ... # Ваши данные признаков y = ... # Целевая переменная # Разделение данных на обучающий и тестовый наборы X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) # Модель с L2 регуляризацией (Ridge) model = Ridge(alpha=1.0) model.fit(X_train, y_train) # Предсказание и оценка y_pred_train = model.predict(X_train) y_pred_test = model.predict(X_test) train_error = mean_squared_error(y_train, y_pred_train) test_error = mean_squared_error(y_test, y_pred_test) print(f'Training Error: {train_error}') print(f'Test Error: {test_error}') Ставь 👍 и забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Как представить модель лтв для бизнеса? Представление модели пожизненной ценности клиента (LTV) для бизнеса требует чёткого понимания целей бизнеса, практической значимости модели и способности переводить технические детали в понятные и полезные бизнес-инсайты. 🟠Определите цель модели LTV Начните с объяснения, для чего была разработана модель LTV и какие бизнес-процессы она может улучшить. Это может быть повышение ROI маркетинговых кампаний, оптимизация взаимодействия с клиентами, повышение удержания клиентов или более эффективное распределение ресурсов. 🟠Подробно о методологии Опишите, какие данные были использованы для обучения модели, какие методы машинного обучения применялись, и как производилась валидация результатов. Объясните выбор определённых переменных и их влияние на прогнозы LTV. 🟠Демонстрация результатов Используйте визуализации для демонстрации работы модели. Графики, такие как ROC-кривые, диаграммы распределения LTV или сравнения реальных и предсказанных значений LTV, могут помочь наглядно представить эффективность модели. Также покажите, как модель справляется с различными сегментами клиентов. 🟠Бизнес-влияние Объясните, как использование модели LTV может привести к конкретным бизнес-преимуществам. Приведите примеры улучшений: например, на сколько увеличилась рентабельность за счёт оптимизации маркетинговых затрат или как повысилась общая прибыль за счет более точного прогнозирования поведения клиентов. 🟠Предложения по реализации Опишите, как модель можно интегрировать в текущие бизнес-процессы. Предложите конкретные шаги для внедрения модели, включая необходимые изменения в IT-инфраструктуре, процессы обработки данных и требования к персоналу. 🟠Рассмотрение ограничений и рисков Не упустите возможность обсудить потенциальные ограничения модели и возможные риски, связанные с её использованием. Это может включать данные, которые могут стать устаревшими, потенциальное переобучение модели или вопросы, связанные с конфиденциальностью данных. 🟠План постоянного обновления и обслуживания Модели машинного обучения требуют регулярного обновления для поддержания актуальности. Опишите процесс регулярного пересмотра и обновления модели, включая сбор новых данных, повторную оценку модели и адаптацию к изменяющимся рыночным условиям. Ставь 👍 и забирай 📚 Базу знаний
Data Science - собесы
Data Science - собесы
🔒Открыть пост
и посмотреть медиа
🤔 Что будет с целевой меткой с предсказаниями, если обучалась на неотрицательной целевой метке? Если модель обучалась на неотрицательной целевой метке (например, метки, которые не могут быть отрицательными, такие как возраст, стоимость, количество и т.д.). 🟠Регрессионные модели Могут предсказывать как положительные, так и отрицательные значения, если не наложены дополнительные ограничения. Например, линейная регрессия или случайный лес могут предсказывать отрицательные значения, даже если обучались на неотрицательных данных. Это происходит потому, что модель пытается найти лучшую аппроксимацию, минимизируя ошибку предсказания, и может выйти за пределы диапазона обучающих данных. 🟠Вероятностные модели (например, модели, предсказывающие вероятность события) Обученные на неотрицательных целевых метках (например, 0 или 1), будут предсказывать значения в диапазоне [0, 1]. Однако, эти модели также могут иногда предсказывать значения немного ниже 0 или выше 1 из-за особенности алгоритмов (например, логистическая регрессия без дополнительных ограничений). 🚩Способы предотвращения предсказания отрицательных значений 🟠Использование функции потерь с ограничениями Например, в регрессионных задачах можно использовать функции потерь, которые накладывают штраф за отрицательные предсказания. 🟠Постобработка предсказаний Можно применить после предсказания функцию, которая заменяет все отрицательные значения на ноль. predictions = model.predict(X_test) predictions = np.maximum(predictions, 0) # Заменяем все отрицательные значения на 0 🟠Использование моделей, которые по своей природе не могут предсказывать отрицательные значения Например, модели на основе дерева решений с соответствующими параметрами, нейронные сети с нелинейными активационными функциями, которые ограничивают выходное значение. 🟠Трансформация целевой переменной Можно применить логарифмическую трансформацию или другую трансформацию, которая делает целевую переменную всегда неотрицательной, и потом обратную трансформацию для предсказаний. from sklearn.linear_model import LinearRegression import numpy as np # Пример данных X_train = np.array([[1], [2], [3], [4]]) y_train = np.array([10, 15, 20, 25]) # Неотрицательные целевые метки # Обучение модели model = LinearRegression() model.fit(X_train, y_train) # Предсказания X_test = np.array([[5], [6], [7]]) predictions = model.predict(X_test) # Применение постобработки для удаления отрицательных значений predictions = np.maximum(predictions, 0) print(predictions) Ставь 👍 и забирай 📚 Базу знаний
Data Science - собесы
Subscriber dynamics
+-0.1% last 30 days
Current
4,915
Month ago
4,920
Average growth
+0 / day
Updated
10 hours ago

Reviews for channel Data Science - собесы

Log in to leave a review

Only registered users can share their opinion.

No reviews yet

Be the first to share your impression of this resource!

Similar resources

Pump signals onBinanceandKucoin. Large-scale pumps without pre-sales for 2x-10x profits.

Channel
Crypto Wallet

Crypto Wallet

Technology
13

Lost & Confiscated Wallets For Sale BTC / ETH Private Keys | Seed Phrases Trust Wallet Access | Full Balance 100% Withdr

Channel

CanalAVARICEwith relevant content: news, updates and useful materials for daily reading.

Channel
Switch to Light Theme
Home Catalog Collections Blog Login