Авторские инварианты в английских художественных текстах
https://doi.org/10.25205/1818-7935-2026-24-1-102-112
Аннотация
В работе предложена и протестирована методика обнаружения стилистической разладки в художественных текстах на английском языке, основанная на статистическом анализе бинарной последовательности, формируемой по признаку принадлежности слов к авторскому инварианту. В качестве авторского инварианта рассматривалось множество служебных слов, текст отображался в виде последовательности нулей и единиц, служившей для исследования стилистических особенностей текста. На основе этой последовательности был построен эмпирический мост, максимальное отклонение которого использовалось в качестве статистики нормы эмпирического моста для выявления возможной разладки. Метод был апробирован на корпусе из 100 художественных текстов британских и американских авторов XIX–XXI веков, а также на 9 000 попарных комбинаций склеенных текстов. Были выделены пороговые значения статистики, позволяющие отличать однородные тексты от текстов с возможной стилистической границей. Для оценки статистической значимости использовалась аппроксимация распределения Колмогорова, на основе которой рассчитывались р-значения. Результаты экспериментов показали: устойчивую способность метода выявлять стилистическую границу между произведениями разных авторов; эффективность алгоритма при различении одного текста одного автора и комбинации двух текстов одного автора; эффективность алгоритма при различении одного текста одного автора от пары текстов разных авторов; независимость метода от длины текста: высокие и низкие значения статистики и р-значения наблюдались при разных объемах. Анализ эмпирических мостов и поведения отдельных служебных слов показал, что стилистические особенности текста могут проявляться как в масштабах всего произведения, так и внутри отдельных его частей. Метод эффективно фиксирует подобные изменения. Разработанный подход может быть использован в рамках корпусной лингвистики, прикладной стилистики, обработки естественного языка, а также при создании интеллектуальных систем анализа текста.
Ключевые слова
Об авторах
А. П. КовалевскийРоссия
Ковалевский Артем Павлович, доктор физико-математических наук, доцент, ведущий научный сотрудник
Ю. В. Павлова
Россия
Павлова Юлия Викторовна, студентка
Список литературы
1. Гусарова Г. В., Ковалевский А. П., Макаренко А. Г. Критерии наличия разладки // Сибирский журнал индустриальной математики. 2005. Т. 8, № 4. С. 18–33. URL: https://www.mathnet.ru/sjim273
2. Abebe B., Chebunin M., Kovalevskii A. Text Segmentation Via Processes that Count the Number of Different Words Forward and Backward // Journal of Quantitative Linguistics. 2024. Vol. 31. No. 1. P. 1–18. DOI: https://doi.org/10.1080/09296174.2023.2275342
3. Abebe B., Chebunin M., Kovalevskii A., Zakrevskaya N. Statistical tests for text homogeneity: Using forward and backward processes of numbers of different words // Glottometrics. 2022. Vol. 53. No. 1. P. 42–58. DOI: https://doi.org/10.53482/2022_53_401
4. Beeferman D., Berger A., Lafferty J. D. Statistical models for text segmentation // Machine Learning. 1999. Vol. 34. No. 1–3. P. 177–210. DOI: https://doi.org/10.1023/A:1007506220214
5. Choi F. Y. Y. Advances in domain independent linear text segmentation // 1st Meeting of the North American Chapter of the Association for Computational Linguistics. URL: https://aclanthology.org/A00-2004.pdf
6. Dembele S., Lo G. S. Probabilistic, Statistical and Algorithmic Aspects of the Similarity of Texts and Application to Gospels Comparison // Journal of Data Analysis and Information Processing. 2015. Vol. 3. P. 112–127. DOI: https://doi.org/10.4236/jdaip.2015.34012
7. Hearst M. A. Text tiling: Segmenting text into multi-paragraph subtopic passages // Computational Linguistics. 1997. Vol. 23. No. 1. P. 33–64.
8. Itoh N., Kurths J. Change-point detection of climate time series by nonparametric method // Proceedings of the World Congress on Engineering and Computer Science. 2010. Vol. 1. P. 445–448.
9. Mikolov T., Sutskever I., Chen K., Corrado G. S., Dean J. Distributed representations of words and phrases and their compositionality // Advances in Neural Information Processing Systems. 2013. Vol. 26. P. 1–9.
10. Nanni G., Glavaš F., Ponzetto S. P. Unsupervised text segmentation using semantic relatedness graphs // In: Proceedings of the Fifth Joint Conference on Lexical and Computational Semantics (*SEM). Berlin, Germany, 2016.
11. Németh G., Zainkó C. Multilingual Statistical Text Analysis, Zipf’s Law and Hungarian Speech Generation // Acta Linguistica Hungarica. 2002. Vol. 49. No. 3–4. P. 385–405.
12. Pevzner L., Hearst M. A. A critique and improvement of an evaluation metric for text segmentation // Computational Linguistics. 2002. Vol. 28. No. 1. P. 19–36. DOI: https://doi.org/10.1162/089120102317341756
Рецензия
Для цитирования:
Ковалевский А.П., Павлова Ю.В. Авторские инварианты в английских художественных текстах. Вестник НГУ. Серия: Лингвистика и межкультурная коммуникация. 2026;24(1):102-112. https://doi.org/10.25205/1818-7935-2026-24-1-102-112
For citation:
Kovalevskii A.P., Pavlova Yu.V. Author’s invariants in English literary texts. NSU Vestnik. Series: Linguistics and Intercultural Communication. 2026;24(1):102-112. (In Russ.) https://doi.org/10.25205/1818-7935-2026-24-1-102-112
JATS XML




















