SvayaИИ-платформаТехнические решенияПродуктыВнедрение
ВойтиПопробовать бесплатно

Документация / Возможности / Языковые модели и машинное обучение

Языковые модели и машинное обучение

Редакция 23 сентября 2026

Для администратораДля службы безопасностиПри подключении языковых моделей и при смене сервиса

Платформа отправляет запросы к языковым моделям российских сервисов. Компания может сменить сервис языковых моделей, не переделывая прикладные решения (задачи), которые работают на платформе. Часть вычислений (например, оценку кредитных заявок) делают модели машинного обучения на обычных процессорах сервера, без видеокарты. Эта страница о том, как платформа выбирает языковую модель для запроса, что платформа делает, когда сервис языковых моделей не отвечает, и как платформа объясняет оценки, которые считают модели машинного обучения.

Термины этой страницы:

  • Задача - это прикладное решение на платформе для одной работы компании (например, для ответов на вопросы клиентов). В задаче записаны шаги этой работы, тексты инструкций для языковой модели, роли и экраны сотрудников. Задачу собирает БизнесМатика или сама компания, и тот, кто ее собрал, называется автором задачи.
  • Класс языковой модели - это группа языковых моделей, подобранных под один вид работы (например, под рассуждение над длинными документами). В шаге задачи записан только класс языковой модели. Выбор модели «по классу задачи» в формулировке раздела 6 ниже означает именно это.
  • Класс данных - это отметка о том, насколько чувствительны данные. От класса данных зависит, можно ли отправить эти данные языковой модели.
  • Правила задачи - это записанные в задаче правила обращения с данными (например, какие классы данных можно передавать языковой модели). Их задает автор задачи.
  • Маскирование - это замена персональных данных и других сведений, которые платформа умеет распознавать (например, номера карты, банковского счета или логина), метками перед отправкой текста языковой модели. Когда ответ языковой модели возвращается, платформа ставит исходные данные на место меток.
  • Токен - это единица длины текста для языковой модели (обычно часть слова). В токенах считаются длина запроса, длина ответа и расход языковых моделей.
  • Бюджет - это предел расхода токенов за календарные сутки.
  • Резервная языковая модель - это следующая языковая модель в списке класса. Платформа отправляет ей запрос, если языковая модель выше в списке не ответила.
  • Скоринг - это числовая оценка, которую считает модель машинного обучения (например, оценка кредитной заявки по данным заявителя).
  • Векторное представление - это запись текста набором чисел, по которой поиск находит документы, близкие по смыслу к вопросу.
  • Переранжирование - это уточнение порядка найденных документов по тому, насколько каждый документ отвечает на вопрос.

6. Маршрутизация обращений к языковым моделям российских сервисов

Маршрутизация обращений к языковым моделям российских сервисов: выбор модели по классу задачи и чувствительности данных, резервная модель, лимиты и бюджеты, работа при недоступности модели.

Смена сервиса языковых моделей без переделки задач

Автор задачи указывает в каждом шаге класс языковой модели и классы данных, которые шаг передает языковой модели. Какая языковая модель какого сервиса ответит на запрос, администратор задает в настройках платформы. Поэтому компания может сменить сервис языковых моделей, не переделывая задачи. Если в списке класса есть языковые модели разных сервисов, сбой одного сервиса не останавливает задачи.

Как платформа выбирает языковую модель для запроса

Классы языковых моделей на платформе следующие:

  • Сильная языковая модель (для сложного рассуждения и длинных документов).
  • Обычная языковая модель (для составления текстов общего назначения).
  • Легкая языковая модель (для коротких ответов, где важна скорость).
  • Языковая модель для запросов с изображениями (принимает текст вместе с картинкой).

У каждого класса есть список языковых моделей в порядке очереди. Запрос уходит первой языковой модели списка, а следующие языковые модели служат резервом. Первыми в списке рекомендуется ставить языковые модели, которые справляются с работой этого класса и обходятся дешевле остальных. Самые дорогие языковые модели ставят в конец списка, в резерв.

Вызвать языковую модель по имени в обход класса нельзя. Поэтому, когда администратор меняет языковые модели в списке класса, изменение касается всех задач, которые используют этот класс.

Классы данных на платформе следующие:

  • Открытые данные (сведения, которые и так публичны).
  • Внутренние данные (например, логины сотрудников и адреса в сети компании).
  • Персональные данные (ФИО, паспорт, телефон и другие сведения о человеке).
  • Особые персональные данные (специальные категории персональных данных по закону о персональных данных, например сведения о здоровье).
  • Банковская тайна (например, номер платежной карты или банковского счета).
  • Коммерческая тайна (сведения, охраняемые режимом коммерческой тайны).

Для каждого класса данных правила задачи задают одно из следующих действий:

  • Передавать языковой модели как есть.
  • Передавать языковой модели только после маскирования.
  • Не передавать.

Если для класса данных, кроме открытых, действие не записано, платформа отклоняет запрос с данными этого класса. Открытые данные уходят к сервису языковых моделей и без записанного действия. Записать действие, по которому персональные данные, особые персональные данные, банковская или коммерческая тайна уходят к сервису языковых моделей без маскирования, нельзя. Если в запросе есть данные хотя бы одного класса, который правила задачи запрещают передавать, платформа не отправляет этот запрос вовсе и записывает отказ в журнал аудита (запись событий для службы безопасности).

Что платформа делает, когда сервис языковых моделей не отвечает

  • Если сервис не ответил вовремя, вернул ошибку или отклонил запрос из-за слишком частых обращений, платформа повторяет запрос. Число повторов и паузы между ними задаются в настройках платформы.
  • Если повторы не помогли, платформа отправляет запрос резервной языковой модели из списка того же класса.
  • Языковую модель, которая отвечает ошибками подряд, платформа на время убирает из списка. Через срок, заданный в настройках, эта языковая модель возвращается в список без участия администратора.
  • Если не отвечает ни одна языковая модель класса, платформа возвращает задаче явный отказ. Ответ за языковую модель платформа не придумывает, и языковую модель другого класса вместо недоступной не подставляет. Что при этом увидит пользователь, определяет задача.
  • Сбой одного сервиса языковых моделей не затрагивает классы, в списках которых нет языковых моделей этого сервиса.

Бюджеты расхода токенов и пределы обращений

Бюджеты задаются для следующих областей:

  • Канал задачи (например, чат задачи на сайте компании). Для канала, открытого всем посетителям сайта, бюджет обязателен, и без бюджета такой канал не работает.
  • Вся платформа в сумме.
  • Служебные обращения самой платформы к языковым моделям (например, обращения языковой модели-оценщика при оценке качества на эталонном наборе).

Когда бюджет исчерпан, платформа до начала следующих суток не отправляет запросы, которые расходуют этот бюджет. На класс более дешевой языковой модели платформа при этом сама не переходит. Кроме бюджетов, в настройках ограничены длина одного ответа языковой модели и частота обращений к каждой языковой модели.

Что администратор задает в настройках выбора языковой модели

В настройках платформы администратор задает следующие значения:

  • Языковые модели каждого класса и их порядок в списке.
  • Число повторов запроса и паузы между ними.
  • Срок, на который языковая модель убирается из списка после ошибок подряд.
  • Бюджеты расхода токенов.
  • Предел длины одного ответа языковой модели.
  • Предел частоты обращений к каждой языковой модели.

Класс языковой модели и классы данных для каждого шага указывает автор задачи. Как администратор меняет эти настройки и как сменить сервис языковых моделей, разобрано на странице «Языковые модели» в группе «Настройка».

Чего платформа не делает при выборе языковой модели

  • Платформа не проверяет, правильно ли автор задачи отметил классы данных шага. Если шаг с персональными данными отмечен как открытый, эти данные все равно ищет и заменяет маскирование.
  • Маскирование заменяет только сведения, которые умеет распознавать (персональные данные, номера карт и счетов, логины). Коммерческую тайну оно не распознает, поэтому от передачи таких сведений защищает только запрет передачи для класса «коммерческая тайна» в правилах задачи.
  • Изображения по ссылкам на внешние сайты платформа не принимает. Картинку передают в самом запросе.
  • Бюджета на одного пользователя нет. Предел расхода действует на канал целиком.
  • Смена сервиса языковых моделей может изменить качество ответов задачи. Поэтому после смены сервиса имеет смысл заново проверить качество на эталонном наборе компании (примерах из работы компании с правильными ответами, подробнее на странице «Самостоятельная настройка»).

11. Машинное обучение без видеокарты

Машинное обучение без видеокарты: классификаторы, скоринг с объяснением результата, построение векторных представлений и переранжирование.

Какую работу модели машинного обучения делают без языковой модели

Часть работы в задачах не требует языковой модели. Эту работу делают модели машинного обучения на обычных процессорах сервера, без видеокарты и без обращения к внешним сервисам. Поэтому при построении векторных представлений и при переранжировании документы компании не покидают платформу.

Модели машинного обучения на платформе делают следующую работу:

  • Скоринг. Вместе с оценкой платформа выдает объяснение, из чего эта оценка сложилась.
  • Классификацию (отнесение текста или записи к одной из заданных категорий). Например, так платформа отбирает сообщения клиентов не по теме задачи, чтобы не отправлять их языковой модели.
  • Построение векторных представлений для поиска по смыслу.
  • Переранжирование. Модель машинного обучения оценивает, насколько каждый найденный документ отвечает на вопрос, и ставит самые подходящие документы выше.

Как платформа объясняет оценку скоринга

Объяснение показывает, насколько каждый признак (одно из данных, по которым считается оценка, например доход заявителя) поднял или опустил оценку. Вклады всех признаков вместе с базовым значением модели машинного обучения (оценкой, от которой отсчитываются вклады) в сумме равны итоговой оценке. Поэтому контролер (сотрудник, который подтверждает решения по заявкам) видит, из каких вкладов сложилась оценка.

Для скоринга платформа выдает объяснение всегда. Если повторить расчет на тех же данных, с той же версией модели машинного обучения и той же версией платформы на сервере с процессором того же типа, оценка и объяснение совпадут с первыми до последнего знака. Поэтому любую выданную оценку можно пересчитать и проверить.

Какие сведения платформа требует о каждой модели машинного обучения

Модель машинного обучения регистрируется на платформе только вместе со следующими сведениями:

  • На каких данных обучена модель машинного обучения.
  • Какими показателями измерено качество этой модели машинного обучения.
  • Как модель машинного обучения обучают заново, когда данные меняются.

Эти сведения собраны в карточке модели машинного обучения. Карточку видят контролер (рядом с объяснением оценки) и аудитор (сотрудник, который проверяет работу платформы по журналу).

Модели машинного обучения в форматах, внутри которых может быть спрятана исполняемая программа, платформа не принимает. Так при загрузке модели машинного обучения на сервере не запустится посторонний код. Прежнюю версию модели машинного обучения можно вернуть в работу без повторной загрузки ее файла.

Что задают в настройках моделей машинного обучения

Автор задачи указывает в шаге, какую модель машинного обучения вызывать. Администратор задает в настройках платформы объем памяти сервера под модели машинного обучения и список моделей машинного обучения, которые загружаются заранее, при запуске платформы. Тогда первый запрос к такой модели машинного обучения не ждет, пока она загрузится.

Чего модели машинного обучения на платформе не делают

  • Модели машинного обучения приходят на платформу уже обученными. Обучать модели машинного обучения внутри платформы нельзя, и программ для обучения в поставке нет.
  • Для построения векторных представлений и для переранжирования используются только модели машинного обучения, которые входят в состав платформы. Свою модель машинного обучения для этой работы задача подключить не может.
  • Модель машинного обучения для векторных представлений на платформе одна, и она рассчитана на русскоязычные тексты.
  • Если переранжирование недоступно, поиск выдает найденные документы без уточнения порядка.