Logo
TGCATALOG
Каталог Подборки Блог
Berloga - науки и технологии

Berloga - науки и технологии

Data Science, Биология, Математика, Физика, IT и Computer Science.

Нет оценок
100
10.09.2026
100
10.09.2026
Нет оценок
100
10.09.2026
Безопасный переход через бот
О канале

Data Science, Биология, Математика, Физика, IT и Computer Science.

Подписчиков 7,863
Тематика Наука
Язык Русский
Ссылка t.me/sberlogabig
Описание

Мультидисциплинарный канал о науке и технологиях. Темы включают Data Science, Биоинформатику, Биологию, Математику, Физику, IT и Computer Science. Подробные материалы для профессионалов и энтузиастов.

Последние посты

Berloga - науки и технологии
Berloga - науки и технологии
🔒Открыть пост
и посмотреть медиа
Интересная штука Ссылка скрыта попытка построить универсальную модель для структурированных (табличных) данных. Идея как в LLM, только вместо языка у нас много-много реальных и синтетических табличных данных для претрейна. В итоге вместо обучения модели с нуля на собственных табличных данных, мы делаем файн-тюн. Ключевые идеи, которые я уловил: 1) Context-Conditional Masked Modeling мы рассматриваем несколько строк таблиц как контекст и несколько фич из определенной строки как запрос. Пытаемся восстановить замаскированные фичи. В результате получаем обучение на совместное распределение. Что тут таргет - вообще не особо важно, модель учиться заполнять пропуски во всех фичах. 2) Модель основана на трансформере, отдельный аттеншн по строкам и столбцам. Вместо позиционного кодирования в LLM тут кодирование колонки (признака), чтобы модель понимала где мы что замаскировали. Эмбединг просто добавляется к значению признака. 3) На этапе предсказания у нас довольно большой выбор что использовать в качестве контекста (можно запихать кучу строк трейна), lumix отбирает по атеншну наиболее важные строки из него и делает предсказание только из них. Своеобразный дата-селекшн вместо feature selection. В статье еще много про то как они синтезировали данные и почему это работает (по их мнению), но это я подробно читать не стал, хотя там много интересного. Из практического: проще всего модель из докера запускать, но сходу что-то у меня не очень завелось, разумного вида трейн передать туда не удается, он разбухает в памяти раз в 100. Но забавно что даже довольно маленький трейн дает не рандомный результат (хотя и слабый, и да xgb даже такой не вытащит из этого трейна). Короче, возможно, это работает, но железа нужно очень много
Berloga - науки и технологии
Динамика подписчиков
+-0.1% за 30 дней
Текущие
7,863
Месяц назад
7,867
Средний рост
+0 / день
Обновлено
1 день назад

Отзывы о канале Berloga - науки и технологии

Авторизуйтесь, чтобы оставить отзыв

Только зарегистрированные пользователи могут делиться своим мнением.

Пока нет отзывов

Станьте первым, кто поделится своим впечатлением об этом ресурсе!

Похожие ресурсы

Курс по физике от Prateek Jain для NEET 2026: ежедневные задания, точные тесты, конспекты и DPP в Telegram.

Канал

Коллекция TED Talks: видео, аудио и полные транскрипты. Идеи, которые меняют мир.

Канал

Материалы по физике для IIT JAM, JEST, TIFR, GATE, CSIR NET, BARC, DRDO, MSc в Telegram.

Канал
Переход на светлую тему
Главная Каталог Подборки Блог Вход