и посмотреть медиа
Kaggling - Kaggle
и посмотреть медиа
Канал о Kaggle: конкурсы, ML, датасеты и советы по data science.
Канал о Kaggle: конкурсы, ML, датасеты и советы по data science.
Kaggling - специализированный канал для поклонников платформы Kaggle. Здесь обсуждаются актуальные соревнования по машинному обучению, анализу данных и ИИ. 🧠 Получите обзоры топ-решений, стратегии и уроки от победителей.
Контент включает ссылки на датасеты, notebooks, туториалы и новости платформы. Идеально для data scientists, желающих участвовать в конкурсах и развивать навыки. 📊
Канал помогает оставаться в курсе трендов ML, делится кодом и советами по оптимизации моделей. Полезно для новичков и профессионалов.
Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradient. Статья вышла еще в 1983 году, но оценить ее реальный вклад можно только в последние лет 10-15. Производные от него методы оптимизации, к сожалению, не стали железным стандартом в индустрии, но довольно популярны у знающих людей Так вот, за свой вклад в математику Юрий Нестеров получил премию Гаусса, с чем я его горячо поздравляю. Это буквально нобелевская премия, но для математиков и высшая форма признания вклада в науку. О том, как работает метод оптимизации и в чем идея, лучше посмотреть вот в этом посте, а я хотел бы примерно рассказать, как так вышло, что метод с лучшей теоретической оценкой не стал стандартом. Мои три подписчика с ММП скажут, что у Adan/NAdam не нормируют градиенты и из-за этого менее устойчивы к правильному LR -> хуже проскакивают турбулентные участки гиперповерхности лосса. Кстати, возмущенные неточностью подписчики с ммп ставьте обезьяну, узнаем сколько вас. Но фатальным ударом для этих методов был таймлайн. Статья про Nadam появилась в 2016, и в этот момент Attention is all you need (Aiayn) уже находилась в процессе написания, так что в ней использовали проверенный Adam как оптимизиатор. После, все побежали воспроизводить результаты у себя и следовали рецепту, описанному в статьей. У нас есть десятки тысяч статей, которые развивают идеи Aiayn и большая часть использует именно Adam. А значит ученых больше наблюдений для Adam и его имплементации больее оптимизированы под современное железо. По практике скажу, что Nesterov momentum мне буста в качестве давал ровно ноль раз, так что приглашаю попустить меня в комментах и объяснить, почему нужно всегда учить именно с Adan.
Открыть канал и посмотреть медиаДобрый день, друзья! Многие, в том числе и я, упустили достаточно важное событие в сфере машинного обучения. За фундаментальный вклад в математическую оптимизацию Юрий Евгеньевич Нестеров получил Премию Карла Фридриха Гаусса — одну из высших международных наград в прикладной математике. Знаковой работой Нестерова стала опубликованная в 1983 году статья «Метод решения задачи выпуклого программирования со скоростью сходимости O(1/k²)». В ней был предложен метод оптимизации первого порядка — модификация градиентных методов, позволяющая значительно ускорить их сходимость. Впоследствии этот подход получил широкую известность как метод Нестерова (Nesterov's momentum, Nesterov Accelerated Gradient, Fast Gradient Method). Хотя метод был предложен ещё в 1983 году, широкое признание и особенно активное практическое применение пришли лишь спустя десятилетия. Сам Юрий Евгеньевич интересно говорит о нынешнем моменте в видеоанонсе премии: «Я ушёл на пенсию в самый неподходящий момент. В момент, когда искусственный интеллект даёт нам новые приложения и много новых испытаний. И я хочу поучаствовать в этом немного. Поэтому странно останавливаться прямо сейчас». Сейчас Юрий Евгеньевич продолжает работать в области Data Science и является профессором Школы наук о данных Китайского университета Гонконга (Шэньчжэнь). Также есть 45-минутная ознакомительная лекция от Юрия Нестерова по методам оптимизации высоких порядков. Рекомендую к просмотру!
Открыть канал и посмотреть медиаВот сама модификация градиентного спуска: шаг обновления складывается из двух частей — накопленной инерции предыдущих шагов с коэффициентом μ и градиента функции с коэффициентом η. Ключевое отличие от обычного momentum в том, что градиент вычисляется не в текущей точке, а в предсказанной: там, где мы окажемся, сделав только инерционную часть шага. Обычно μ=0.9, а η — темп обучения (learning rate). Для машинного обучения, используя классические обозначения, x=w — веса модели, а f(w)=L(θw(*), y) — функция ошибки, где θw(*) — предсказание модели, параметризованной w, а y — искомое значение. При этом градиент берётся по w.
Открыть канал и посмотреть медиаТолько зарегистрированные пользователи могут делиться своим мнением.
Станьте первым, кто поделится своим впечатлением об этом ресурсе!
Быстрая доставка автомобилей из Азии и выгодные условия покупки.
Чип-тюнинг, тюнинг выхлопа и детейлинг для улучшения характеристик автомобиля.
Канал по информатике: программирование, хакинг, ИИ, кибербезопасность и всё связанное с IT.