Минцифры может начать субсидировать датасеты для обучения ИИ
Минцифры и представители бизнеса обсуждают субсидии или гранты на формирование качественных датасетов для обучения больших фундаментальных моделей. Государство может взять на себя часть расходов на подготовку таких наборов.
Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш телеграм-канал, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!
Предложение прозвучало на сентябрьском заседании профильной рабочей группы. Стороны должны принять окончательное решение до конца месяца.
Кто обсуждает субсидии на датасетыПредставители бизнеса, госкорпораций и правительства обсуждали инициативу на заседании рабочей группы «Меры поддержки ИИ» еще 10 сентября. Два участника обсуждений рассказали об этом «Ъ», а еще один собеседник, знакомый с повесткой встречи, подтвердил информацию.
Источник пояснил, что мера способна дать заметный эффект. По его оценке, господдержка позволит создавать качественные русскоязычные и отраслевые наборы данных.
Сразу несколько исследовательских команд смогут получить доступ к одним и тем же массивам. Субсидии также могут снизить повторное использование данных и дублирование затрат.
Регулятор и бизнес должны согласовать финансовые меры поддержки до 30 сентября 2026 года. Готовые датасеты предназначены для последующего использования научными и исследовательскими центрами.
Где еще ищут данные для обучения моделейВласти уже занимаются похожей задачей в научной сфере. Михаил Мишустин подписал перечень поручений, по которому Минобрнауки, Минэкономразвития, Роспатент и Минцифры до 25 ноября проработают механизм обучения суверенных и национальных моделей на данных единой системы. Защита интеллектуальной собственности остается главным условием.
Частные зарубежные компании собирают собственные массивы самостоятельно. Илон Маск объявил, что SpaceX передаст инженерные данные для обучения новой модели Grok на 2 трлн параметров. Сведения под действием экспортных ограничений ITAR в набор не войдут.
Ценность таких наборов зависит и от вычислительных мощностей. Китайская компания Meituan выпустила LongCat-2.0 на 1,6 трлн параметров и обучила модель целиком на кластере из 50 000 отечественных чипов без оборудования Nvidia. В Meituan назвали память ускорителей главным проблемным местом при таком обучении.
Хотите получить доступ к экспертным инсайдам? Подписывайтесь на наш новостной телеграм-канал, а также вступайте в сообщество BeInCrypto! Читайте последние новости и свежую аналитику криптовалют, ИИ и фондовых рынков. Будьте на шаг впереди толпы каждый день!
Источник: https://ru.beincrypto.com/mincifry-subsidii-datasety-obuchenie-ii/