Фрагмент для ознакомления
2
1.1. Задачи классификации текстов в обработке естественного языка
Классификация текстов представляет собой одну из фундаментальных задач обработки естественного языка (NLP), заключающуюся в автоматическом назначении одного или нескольких ярлыков (категорий) текстовому документу на основе его содержания. Процесс классификации основывается на анализе признаков текста и их сопоставлении с предварительно определённым набором классов. Согласно Jurafsky и Martin, классификация лежит в сердце языковой обработки и интеллекта, выступая ключевым инструментом для автоматизации принятия решений в широком спектре приложений [1].
Современная практика различает несколько типов задач классификации текстов в зависимости от структуры выходных данных. Бинарная классификация предполагает разделение текста на две взаимоисключающие категории. Классическим примером является задача выявления спама: электронное письмо классифицируется либо как спам, либо как легитимное сообщение. Аналогично, в анализе тональности (sentiment analysis) текст определяется как содержащий либо положительное, либо отрицательное выражение отношения автора к объекту обсуждения [9].
Мультиклассовая классификация расширяет возможности бинарного случая, позволяя относить текст к одному из K классов, где K > 2. Типичным примером служит трёхуровневая классификация тональности, при которой текст может быть отнесен к положительному, отрицательному или нейтральному классу. Другой важный случай — классификация по тематикам (topic categorization), когда документы распределяются по предметным областям: политика, спорт, технология, здоровье и т.д.
Области практического применения классификации текстов охватывают множество предметных областей. Анализ тональности широко используется в маркетинге и управлении репутацией компаний для извлечения мнений клиентов из отзывов о продуктах и услугах, комментариев в социальных сетях и обзорах. Фильтрация спама применяется почтовыми сервисами и системами безопасности для идентификации нежелательной корреспонденции и защиты пользователей [5]. Тематическая категоризация текстов используется в информационных системах, библиотеках и поисковых системах для организации и поиска документов. Кроме того, классификация текстов находит применение в определении языка документа (language identification), атрибуции авторства (authorship attribution), классификации документов по типам (например, деловые письма, научные статьи, новостные сообщения) и многих других задачах.
Успешное решение задач классификации текстов требует правильного выбора математических методов и алгоритмов, способных извлекать релевантные признаки из текстовых данных и на их основе делать обоснованные предсказания. Переход от ручного анализа текстов к автоматизированным методам позволяет обрабатывать большие объёмы данных с высокой скоростью и консистентностью.
Фрагмент для ознакомления
3
1. Jurafsky D., Martin J. H. Speech and Language Processing. 3rd ed. draft. Chapter 4: Naive Bayes and Sentiment Classification. — Stanford University, 2023. — URL: https://web.stanford.edu/~jurafsky/slp3/4.pdf (дата обращения: 22.11.2025).
2. Minaee S., Kalchbrenner N., Cambria E., Nikzad N., Chenaghlu M., Gao J. Deep Learning Based Text Classification: A Comprehensive Review // ACM Computing Surveys. — 2021. — Vol. 54, № 3. — P. 1–40. — DOI: 10.1145/3439726.
3. Wu L., Cui P., Pei J., Zhao L., Guo X. Graph Neural Networks for Natural Language Processing: A Survey // Foundations and Trends in Machine Learning. — 2023. — Vol. 16, № 2. — P. 119–328. — DOI: 10.1561/2200000096.
4. Zulqarnain M., Sheikh R., Hussain S., Sajid M., Abbas S. N., Majid M., Ullah U. Text Classification Using Deep Learning Models: A Comparative Review // Computing and Cognitive Data Science. — 2023. — Vol. 5, № 1. — P. 28–54. — DOI: 10.37256/ccds.5120243528.
5. Alyasiri O. M., Cheah Y.-N. Multi-Class Text Classification using Machine Learning Techniques // Engineering, Technology & Applied Science Research. — 2025. — Vol. 15, № 3. — P. 22598–22604. — DOI: 10.48550/etasr.9994.
6. Taha K., Yoo P. D. A comprehensive survey of text classification techniques: from shallow learning to deep learning // Expert Systems with Applications. — 2024. — Vol. 248. — Article 123804. — DOI: 10.1016/j.eswa.2024.123804.
7. Tsirmpas D., Gkikas D., Koutsomitropoulos D., Papadakis G. Neural natural language processing for long texts: A survey of methods and trends // Engineering Applications of Artificial Intelligence. — 2024. — Vol. 133. — Article 108226. — DOI: 10.1016/j.engappai.2024.108226.
8. Zhou Y., Liu C., Pan Y., Yang X., Zhou Y., Qian Y. Natural Language Processing with Improved Deep Learning Model for Syntactic Analysis // Computational Intelligence and Neuroscience. — 2022. — Vol. 2022. — Article 6028693. — DOI: 10.1155/2022/6028693.
9. Xu C., McAuley J. A Survey on Dynamic Neural Networks for Natural Language Processing // Findings of the Association for Computational Linguistics: EACL 2023. — Dubrovnik, Croatia, 2023. — P. 2325–2348. — DOI: 10.48550/arXiv.2202.07101.
10. Zhang C., Lei J., Pan J., Luo Y., Zhang H. Text Classification Using Deep Learning Methods: A Survey // IEEE Access. — 2022. — Vol. 10. — P. 128158–128176. — DOI: 10.1109/ACCESS.2022.3227667.
11. Zhou C., Sun C., Liu Z., Lau F. C. M. A C-LSTM Neural Network for Text Classification // arXiv preprint. — 2015. — arXiv:1511.08630. — DOI: 10.48550/arXiv.1511.08630.
12. Jamshidi S., Beigy H. Effective text classification using BERT, MTM LSTM, and DT // Data & Knowledge Engineering. — 2024. — Vol. 151. — Article 102294. — DOI: 10.1016/j.datak.2024.102294.
13. Zaman-Khan H., Nisar H. Enhancing Text Classification Using BERT: A Transfer Learning Approach // Computación y Sistemas. — 2024. — Vol. 28, № 4. — P. 2279–2289. — DOI: 10.13053/cys-28-4-5159.
14. Abdelmotaleb H., Eldin E. A Comparative Study of Word Embedding Techniques for Multi-Label Text Classification // Expert Systems with Applications. — 2025. — Vol. 264. — Article 125650. — DOI: 10.1016/j.eswa.2025.125650.
15. Romanyshyn N., Romanyshyn M., Chaplyak Y. Learning Word Embeddings for Ukrainian // Proceedings of the 4th Ukrainian NLP Workshop. — 2023. — P. 16–28. — URL: https://aclanthology.org/2023.unlp-1.3.pdf (дата обращения: 22.11.2025).
16. Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser L., Polosukhin I. Attention Is All You Need // Advances in Neural Information Processing Systems. — 2017. — Vol. 30. — P. 5998–6008.
17. Zhang N., Kim H. A Survey on Attention mechanism in NLP // IEEE International Conference on Consumer Electronics and Computer Engineering. — 2023. — P. 1041–1044. — DOI: 10.1109/ICCECE58074.2023.10049971.
18. Ricciardi R., Siino M., Tinnirello I., La Cascia M. A multilingual BERT-based classification of reviews for Mediterranean touristic destinations // Scientific Reports. — 2025. — Vol. 15. — Article 9418. — DOI: 10.1038/s41598-025-09418-9.
19. Keswani A., Khanna S., Sharma V. Multi-Class Text Classification using Machine Learning & Deep Learning Models with BERT Embeddings // IEEE International Conference on Artificial Intelligence and Knowledge Discovery in Concurrent Engineering. — 2023. — P. 1–7. — DOI: 10.1109/ICEECCOT59340.2023.10425423.