Как данные для обучения LLM и знания о реальном мире улучшают модель Сбера

21 сентября 2026

Открытые данные уже упёрлись в потолок: дальше качество моделей растёт только за счёт узкоспециализированных знаний. Алексей Сандаков, который отвечает за данные для обучения GigaChat, простым языком объясняет, как учатся большие модели, почему банку нужна своя модель и почему «данные — новая нефть» — это не метафора. Доклад для тех, кто хочет понимать, на чём держится качество ИИ и где в этом ценность данных вашей компании.


Алексей Сандаков — исполнительный директор управления по работе с данными для ИИ Сбера

Видео
Как данные для обучения LLM и знания о реальном мире улучшают модель Сбера

В записи вы узнаете:

  • зачем банку собственная модель и почему персональные данные нельзя отдавать во внешние сервисы;
  • как модель проходит четыре этапа обучения — «школа», «вуз», «наставник» и специализация;
  • как 20 отраслевых учебников подняли точность GigaChat в целлюлозном деле с 10 до 78 %, а карточки товаров маркетплейса — на 40 %;
  • почему на синтетических данных модель коллапсирует и упирается примерно в 80 % качества исходной;
  • почему знания людей, которые боятся потерять работу, как раз и становятся главной ценностью для ИИ.
  • Полная запись выступления — 25 минут.

    Любая модель сильна ровно настолько, насколько чисты ваши данные, — и учётные данные здесь первые. Комплексный аудит с налогами от «Правовест Аудит» приводит отчётность и налоги в порядок: заключение по стандартам МСА, найденные резервы, защита 3 года.

Наверх