и посмотреть медиа
Kaggling - Kaggle
и посмотреть медиа
Канал о Kaggle: конкурсы, ML, датасеты и советы по data science.
Канал о Kaggle: конкурсы, ML, датасеты и советы по data science.
Kaggling - специализированный канал для поклонников платформы Kaggle. Здесь обсуждаются актуальные соревнования по машинному обучению, анализу данных и ИИ. 🧠 Получите обзоры топ-решений, стратегии и уроки от победителей.
Контент включает ссылки на датасеты, notebooks, туториалы и новости платформы. Идеально для data scientists, желающих участвовать в конкурсах и развивать навыки. 📊
Канал помогает оставаться в курсе трендов ML, делится кодом и советами по оптимизации моделей. Полезно для новичков и профессионалов.
Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradient. Статья вышла еще в 1983 году, но оценить ее реальный вклад можно только в последние лет 10-15. Производные от него методы оптимизации, к сожалению, не стали железным стандартом в индустрии, но довольно популярны у знающих людей Так вот, за свой вклад в математику Юрий Нестеров получил премию Гаусса, с чем я его горячо поздравляю. Это буквально нобелевская премия, но для математиков и высшая форма признания вклада в науку. О том, как работает метод оптимизации и в чем идея, лучше посмотреть вот в этом посте, а я хотел бы примерно рассказать, как так вышло, что метод с лучшей теоретической оценкой не стал стандартом. Мои три подписчика с ММП скажут, что у Adan/NAdam не нормируют градиенты и из-за этого менее устойчивы к правильному LR -> хуже проскакивают турбулентные участки гиперповерхности лосса. Кстати, возмущенные неточностью подписчики с ммп ставьте обезьяну, узнаем сколько вас. Но фатальным ударом для этих методов был таймлайн. Статья про Nadam появилась в 2016, и в этот момент Attention is all you need (Aiayn) уже находилась в процессе написания, так что в ней использовали проверенный Adam как оптимизиатор. После, все побежали воспроизводить результаты у себя и следовали рецепту, описанному в статьей. У нас есть десятки тысяч статей, которые развивают идеи Aiayn и большая часть использует именно Adam. А значит ученых больше наблюдений для Adam и его имплементации больее оптимизированы под современное железо. По практике скажу, что Nesterov momentum мне буста в качестве давал ровно ноль раз, так что приглашаю попустить меня в комментах и объяснить, почему нужно всегда учить именно с Adan.
Открыть канал и посмотреть медиаSolo los usuarios registrados pueden compartir su opinión.
¡Sé el primero en compartir tu experiencia con este recurso!
Canal con reseñas y noticias del mundo del automóvil.
Canal de informática: programación, hacking, IA, ciberseguridad y todo lo relacionadoIT.