Классификация — присвоение книге или документу индекса в системе ББК, УДК или другой схеме — одна из самых квалифицированных частей библиотечной работы. Классификатор должен понять содержание документа, найти подходящую рубрику в таблицах, учесть специфику издания и правила библиотеки. Когда документов тысячи, это занимает большую часть рабочего времени. ИИ может предложить варианты классификационных индексов на основе анализа текста — названия, аннотации, оглавления, ключевых слов. Точность предложений не абсолютна, но они дают стартовую точку, ускоряя работу в несколько раз. Разбираем, как ИИ классифицирует документы, какие технологии для этого используются и что всё равно требует проверки человека (общий обзор применения искусственного интеллекта в библиотеке — в отдельной статье).
Оглавление
- Какие задачи классификации решает ИИ
- Как работает автоматическая классификация
- Присвоение индексов ББК и УДК
- Определение жанров и типов документов
- Автоматическое присвоение предметных рубрик
- Обучение модели на данных библиотеки
- Технологии и алгоритмы классификации
- Примеры внедрений в библиотеках
- Что обязательно проверять вручную
- Частые вопросы
Какие задачи классификации решает ИИ
Классификация библиотечных документов включает несколько уровней — от общей предметной области до конкретного индекса в таблицах. ИИ может помогать на каждом уровне.
Определение предметной области
Первый шаг — понять, к какой широкой области знания относится документ: естественные науки, техника, социальные науки, искусство, литература. ИИ делает это на основе названия и ключевых слов с высокой точностью — ошибки возможны только на междисциплинарных работах.
Присвоение классификационного индекса
ББК, УДК, Dewey Decimal Classification — любая иерархическая система классификации. ИИ анализирует текст документа и предлагает наиболее подходящий индекс из таблиц. Это не всегда точный ответ, но сужает поиск с нескольких тысяч вариантов до 3-5.
Определение жанра и типа издания
Учебник, монография, справочник, художественная проза, поэзия, сборник статей — ИИ может определить тип по формальным признакам и структуре текста. Это важно для правильного отражения документа в каталоге и для фасетного поиска.
Присвоение тематических рубрик
Если библиотека использует собственную систему тематических рубрик (помимо или вместо ББК/УДК), ИИ можно обучить присваивать их автоматически на основе существующих размеченных примеров (подробнее об автоматической генерации других метаданных — в статье ИИ для создания библиотечных метаданных).
Как работает автоматическая классификация
Автоматическая классификация документов — это задача машинного обучения. Модель учится связывать содержание документа с классом (индексом, рубрикой, жанром) на основе примеров.
Этапы работы модели
- Модель получает на вход текст документа — обычно название, аннотацию, ключевые слова, иногда полный текст (если доступен)
- Текст преобразуется в числовое представление, которое модель может анализировать (векторизация)
- Модель сравнивает это представление с примерами из обучающей выборки и находит наиболее похожие
- На основе похожих примеров модель предлагает классификационный индекс или несколько вариантов с оценкой уверенности
- Классификатор (человек) видит предложения модели и выбирает окончательный вариант или корректирует его
Два подхода к обучению
Обучение с учителем (supervised learning)
Модель обучается на размеченных данных — документах, для которых классификационные индексы уже проставлены вручную. Если у библиотеки есть несколько тысяч таких записей, их можно использовать для обучения модели. Чем больше примеров — тем точнее результат.
Трансферное обучение (transfer learning)
Модель сначала обучается на большом общем корпусе текстов, а затем дообучается на данных конкретной библиотеки. Этот подход требует меньше размеченных примеров и быстрее даёт рабочий результат.

Присвоение индексов ББК и УДК
ББК (Библиотечно-библиографическая классификация) и УДК (Универсальная десятичная классификация) — основные системы, используемые в российских библиотеках. Обе — иерархические: индекс состоит из нескольких уровней детализации.
Как ИИ определяет индекс ББК
Модель анализирует название и аннотацию, определяет предметную область, затем уточняет индекс, двигаясь по таблицам от общего к частному. Например, для книги по истории России модель сначала определяет «История» (6), затем «История России» (63.3), затем конкретный период.
Таблица точности присвоения индексов по типам документов
| Тип документа | Точность (верхний уровень) | Точность (полный индекс) | Комментарий |
|---|---|---|---|
| Учебники по одной дисциплине | 95%+ | 80–90% | Тема обычно указана в названии |
| Научные монографии | 90–95% | 75–85% | Требуется анализ аннотации и оглавления |
| Справочники и энциклопедии | 90%+ | 70–80% | Широкий охват тем усложняет детализацию |
| Междисциплинарные работы | 75–85% | 60–70% | ИИ может выбрать только одну тему |
| Художественная литература | 85–90% | 65–75% | Жанр определяется хорошо, детали — хуже |
| Сборники статей | 70–80% | 50–65% | Содержание неоднородно, нужна экспертиза |
УДК: особенности автоматизации
УДК — более детализированная система, чем ББК, и включает возможность комбинировать индексы для многоаспектных документов. ИИ может предложить основной индекс, но комбинирование обычно требует ручной работы — модель не всегда понимает, какие аспекты важны для конкретной библиотеки.
Определение жанров и типов документов
Жанр и тип издания — важные метаданные, которые помогают читателю ориентироваться в каталоге. ИИ может определять их автоматически с высокой точностью.
Признаки, по которым ИИ определяет тип издания
Учебник
Наличие слов «учебник», «учебное пособие», «курс лекций» в названии; структура с главами, контрольными вопросами, списком литературы; указание уровня образования или специальности.
Монография
Научный стиль, аннотация с указанием на исследование, наличие библиографии, отсутствие учебных элементов. Обычно один автор или небольшой авторский коллектив.
Справочник
Алфавитная или тематическая структура статей, краткость изложения, отсутствие сквозного повествования. Слова «словарь», «энциклопедия», «справочник» в названии.
Художественная литература
Отсутствие научной терминологии, повествовательный стиль, указание жанра (роман, повесть, рассказы, стихи) в подзаголовке или аннотации.
Определение жанра художественной литературы
Для художественных произведений ИИ может определять жанр — детектив, фантастика, любовный роман, классическая проза, поэзия — на основе ключевых слов и стилистических особенностей текста. Точность для популярных жанров превышает 80%.
Автоматическое присвоение предметных рубрик
Предметные рубрики — контролируемый словарь терминов, который описывает содержание документа. В отличие от ББК и УДК, которые фиксированы, библиотека может использовать собственную систему рубрик или адаптировать стандартную.
Как обучить модель присваивать рубрики
Модель обучается на существующих записях каталога: для каждого документа известны его текст (название, аннотация) и проставленные рубрики. Модель учится находить связь между содержанием и рубриками. После обучения она может предлагать рубрики для новых документов.
Минимальный размер обучающей выборки
Для базового качества нужно не менее 1000 размеченных документов на каждую рубрику. Если рубрик много, а примеров мало — модель будет ошибаться. В таком случае лучше начать с дообучения готовой языковой модели (transfer learning), которая уже понимает смысл текстов.

Обучение модели на данных библиотеки
Готовые универсальные модели работают на уровне 60-70% точности для типовых задач. Дообучение на данных конкретной библиотеки повышает точность до 80-90%, особенно если фонд специализированный.
Что нужно для дообучения
- Выгрузка из каталога: записи с заполненными полями классификационного индекса или предметных рубрик (обычно несколько тысяч записей)
- Текстовые данные документов: название, аннотация, ключевые слова, оглавление (если есть)
- Вычислительные ресурсы: дообучение модели на нескольких тысячах документов занимает несколько часов на современном компьютере с GPU
Как оценить, нужно ли дообучение
Запустите готовую модель на выборке из 100-200 документов вашего фонда и посмотрите на точность предложений. Если верхний уровень классификации определяется правильно в 80%+ случаев — можно начать с готовой модели и дообучать по мере накопления правок. Если точность ниже 70% — дообучение нужно сразу.
Непрерывное обучение на исправлениях
Каждый раз, когда классификатор исправляет предложение ИИ, эта правка должна попадать обратно в систему. Модель периодически переобучается на обновлённых данных и становится точнее. Без обратной связи модель будет повторять те же ошибки.
Технологии и алгоритмы классификации
Автоматическая классификация текстов опирается на несколько классов алгоритмов. Выбор зависит от размера обучающей выборки и требуемой точности.
Таблица технологий по задачам
| Задача | Технология | Примеры моделей / библиотек | Когда использовать |
|---|---|---|---|
| Присвоение индексов ББК/УДК | Text classification (многоклассовая) | BERT, RoBERTa, DistilBERT, fastText | Есть размеченная выборка от 1000 примеров |
| Определение жанра | Text classification | Логистическая регрессия, SVM, fastText | Жанры чётко различимы по ключевым словам |
| Присвоение предметных рубрик | Multi-label classification | BERT for multi-label, XML-CNN | Документ может относиться к нескольким рубрикам |
| Кластеризация документов | Unsupervised clustering | K-means, DBSCAN, HDBSCAN | Нет размеченных данных, нужно найти темы |
| Поиск похожих документов | Embedding similarity | Sentence-BERT, Universal Sentence Encoder | Нужно предложить похожие по теме документы |
BERT и языковые модели
BERT (Bidirectional Encoder Representations from Transformers) и его варианты — текущий стандарт для задач классификации текстов. Модель понимает контекст и значение слов, а не только их частоту. Это даёт высокую точность даже на сложных случаях. Для российских библиотек можно использовать русскоязычные версии: ruBERT, DeepPavlov BERT.
fastText для быстрой классификации
Если нужна высокая скорость и обучающая выборка большая (десятки тысяч документов), fastText работает быстрее BERT и даёт приемлемую точность. Подходит для первичной сортировки документов по широким категориям.
Примеры внедрений в библиотеках
Библиотека Конгресса США (Library of Congress)
Использует автоматическую классификацию для присвоения Library of Congress Classification (LCC) и предметных рубрик LCSH. Модель обучена на миллионах записей каталога. Для монографий по одной дисциплине точность полного индекса превышает 85%, для междисциплинарных работ классификатор вручную выбирает из 3-5 предложенных вариантов.
Национальная библиотека Нидерландов
Автоматически классифицирует оцифрованные исторические документы по тематическим рубрикам. ИИ анализирует распознанный текст (OCR) и предлагает рубрики. Точность для документов 19-20 века — около 75%, каталогизаторы проверяют выборочно, корректируют ошибки, модель переобучается ежемесячно.
Университетские библиотеки
Многие университетские библиотеки используют автоматическую классификацию для диссертаций и электронных публикаций преподавателей. ИИ присваивает предметные рубрики на основе названия, аннотации и ключевых слов, автор может скорректировать перед публикацией в репозитории.
Что обязательно проверять вручную
Даже при высокой точности модели автоматическая классификация без проверки создаёт риски. Вот что требует обязательной экспертной оценки.
Междисциплинарные работы
Документы на стыке нескольких областей знания ИИ часто классифицирует односторонне — выбирает одну тему и игнорирует другие. Классификатор должен дополнить индексы или выбрать комбинированный индекс вручную.
Редкие и специализированные издания
Документы, которых мало в обучающей выборке — узкоспециальные темы, региональные издания, редкие жанры, — модель классифицирует хуже. Требуется проверка и корректировка.
Документы со сложной структурой
Сборники статей разных авторов, антологии, многотомные издания с разными темами в томах — для них нужна ручная классификация каждого тома или раздела.
Архивные материалы и рукописи
ИИ плохо справляется с документами, у которых нет чёткого названия, аннотации и структуры. Для архивных материалов классификация остаётся преимущественно ручной работой.
Чек-лист внедрения автоматической классификации
- Определить, какие классификационные задачи автоматизировать (начать с определения предметной области — это наименее рискованно)
- Проверить наличие размеченных данных: записи каталога с проставленными индексами ББК/УДК или предметными рубриками
- Выбрать технологию: готовая языковая модель с дообучением (если примеров мало) или обучение с нуля (если примеров десятки тысяч)
- Запустить пилот на выборке из 200-500 документов, оценить точность на разных типах изданий
- Настроить рабочий процесс: модель предлагает индексы, классификатор выбирает и корректирует
- Обеспечить обратную связь: исправления классификатора попадают обратно в обучающую выборку
- Зафиксировать правила проверки: какие типы документов требуют обязательной ручной проверки
- Организовать периодическое переобучение модели (раз в месяц или квартал) на обновлённых данных
- Вести журнал ошибок: фиксировать, на каких типах документов модель ошибается чаще всего, чтобы улучшить обучающую выборку
Частые вопросы
Может ли ИИ полностью заменить человека в классификации?
Нет. ИИ хорошо справляется с типовыми случаями — учебники по одной дисциплине, популярные жанры художественной литературы, справочники с чёткой темой. Но междисциплинарные работы, редкие издания, документы со сложным содержанием требуют экспертной оценки. ИИ предлагает варианты, человек выбирает.
Какие классификационные системы поддерживает ИИ?
Модели можно обучить на любой классификационной системе — ББК, УДК, Library of Congress Classification, Dewey Decimal Classification. Главное условие — наличие достаточного количества размеченных примеров (обычно несколько тысяч записей) для обучения модели.
Как точно ИИ определяет классификационные индексы?
Точность зависит от типа документа и качества обучающих данных. Для монографий по одной дисциплине — 80-90%, для междисциплинарных работ — 60-70%, для художественной литературы и архивных документов — ниже. Модель, обученная на данных конкретной библиотеки, работает точнее универсальной.
Нужно ли дообучать модель на данных своей библиотеки?
Зависит от специфики фонда. Если библиотека использует стандартные рубрикаторы и работает с типовыми изданиями — можно начать с готовой модели. Если фонд узкоспециализированный или используется локальная система классификации — дообучение на собственных данных повысит точность на 10-20%.
Что почитать
- Artificial intelligence in libraries: A review of applications and implications — обзор применения ИИ в библиотеках, включая автоматизацию классификации
- American Library Association (ALA) — ресурсы и рекомендации по использованию ИИ в библиотечной работе
- AI at the Libraries – NC State University — примеры внедрений ИИ в университетской библиотеке
Автоматизируйте классификацию документов
Если вы хотите внедрить автоматическую классификацию, но не знаете, с чего начать, — посмотрите наши решения для библиотек. Мы помогаем настроить модели под конкретный фонд и рубрикаторы, чтобы ИИ взял на себя рутинную часть работы, а специалисты занимались экспертизой сложных случаев.
Узнать больше о наших решениях для автоматизации библиотечных процессов