Ефективність статистичних критеріїв для визначення стильових характеристик текстів

Проаналізовано особливості підвищення достовірності встановлення звичайної та стильової атрибуції текстів, застосовуючи статистичні критерії Лемана-Розенблатта та Стьюдента. Запропоновано методологію застосування поєднання статистичних критеріїв Лемана-Розенблатта та Стьюдента для здійснення атрибуц...

Full description

Bibliographic Details
Main Authors: І. Ю. Хомицька, В. М. Теслюк, І. Б. Базилевич
Format: Article
Language:English
Published: Ukrainian National Forestry University 2023-08-01
Series:Науковий вісник НЛТУ України
Subjects:
Online Access:https://nv.nltu.edu.ua/index.php/journal/article/view/2527
_version_ 1797672208675373056
author І. Ю. Хомицька
В. М. Теслюк
І. Б. Базилевич
author_facet І. Ю. Хомицька
В. М. Теслюк
І. Б. Базилевич
author_sort І. Ю. Хомицька
collection DOAJ
description Проаналізовано особливості підвищення достовірності встановлення звичайної та стильової атрибуції текстів, застосовуючи статистичні критерії Лемана-Розенблатта та Стьюдента. Запропоновано методологію застосування поєднання статистичних критеріїв Лемана-Розенблатта та Стьюдента для здійснення атрибуції текстів на основі визначення довжини слів та стильової атрибуції текстів на фонологічному рівні. Визначено залежність ефективності статистичних критеріїв від трьох основних чинників: обсягу вибірки, рівня мови, на якому здійснюється атрибуція текстів, та лінгвістичного матеріалу дослідження. Наведено алгоритм здійснення атрибуції текстів та стильової атрибуції текстів мовою програмування Java. Запропоновано поєднання двох основних підходів до здійснення стильової атрибуції текстів, яке може використовуватися і для авторської атрибуції. Перший підхід ґрунтується на визначенні розподілу довжини слів за допомогою критерію Лемана-Розенблатта, другий – на визначенні відмінностей у частоті вживання груп приголосних фонем, використовуючи критерій Стьюдента. Встановлено оптимальний обсяг вибірки. У першому випадку обсяг вибірки становить 50 000 літер, у другому – 30 000 фонем. Проведено атрибуцію текстів на матеріалі статистичних даних, отриманих з художніх творів Данієля Дефо "Робінзон Крузо" (XVIII ст.) та Пауліни Сари Джо Моєс "Я перед Вами" (XXI ст.). Стильову атрибуцію проведено на матеріалі статистичних даних, отриманих з газетного (The Daily Telegraph) (XXI ст.) та наукового стилів (Acta Physica Polonica) (XXI ст.). Встановлено ефективність статистичних критеріїв Лемана-Розенблатта та Стьюдента для здійснення атрибуції та стильової атрибуції текстів, визначаючи розподіл довжини слів та частоту вживання груп приголосних фонем. Результати отримано з довірчою ймовірністю 95 %. Розроблено структуру програмної системи атрибуції тексту та стильової атрибуції. Структура ґрунтується на модульному принципі. Введено модулі атрибуції текстів та стильової атрибуції. Розроблене програмне забезпечення має широкий спектр застосування. Його можна використовувати і для авторської атрибуції. Практичне застосування атрибуції текстів та стильової атрибуції здійснюється у галузі філології та у галузях, що стосуються визначення атрибуції текстів та стильової приналежності тексту. Авторська атрибуція має практичну цінність у кожній галузі людської діяльності, в якій потрібно встановити авторство тексту. Це дослідження є розширеним і доповненим щодо наших попередніх досліджень, присвяченим авторській атрибуції.
first_indexed 2024-03-11T21:26:42Z
format Article
id doaj.art-3e6796a2c96e472a9212c6cd247743b4
institution Directory Open Access Journal
issn 1994-7836
2519-2477
language English
last_indexed 2024-03-11T21:26:42Z
publishDate 2023-08-01
publisher Ukrainian National Forestry University
record_format Article
series Науковий вісник НЛТУ України
spelling doaj.art-3e6796a2c96e472a9212c6cd247743b42023-09-27T23:41:48ZengUkrainian National Forestry UniversityНауковий вісник НЛТУ України1994-78362519-24772023-08-0133410.36930/40330413Ефективність статистичних критеріїв для визначення стильових характеристик текстівІ. Ю. Хомицька0В. М. Теслюк1І. Б. Базилевич2Національний університет "Львівська політехніка", м. ЛьвівНаціональний університет "Львівська політехніка", м. ЛьвівНаціональний університет "Львівська політехніка", м. ЛьвівПроаналізовано особливості підвищення достовірності встановлення звичайної та стильової атрибуції текстів, застосовуючи статистичні критерії Лемана-Розенблатта та Стьюдента. Запропоновано методологію застосування поєднання статистичних критеріїв Лемана-Розенблатта та Стьюдента для здійснення атрибуції текстів на основі визначення довжини слів та стильової атрибуції текстів на фонологічному рівні. Визначено залежність ефективності статистичних критеріїв від трьох основних чинників: обсягу вибірки, рівня мови, на якому здійснюється атрибуція текстів, та лінгвістичного матеріалу дослідження. Наведено алгоритм здійснення атрибуції текстів та стильової атрибуції текстів мовою програмування Java. Запропоновано поєднання двох основних підходів до здійснення стильової атрибуції текстів, яке може використовуватися і для авторської атрибуції. Перший підхід ґрунтується на визначенні розподілу довжини слів за допомогою критерію Лемана-Розенблатта, другий – на визначенні відмінностей у частоті вживання груп приголосних фонем, використовуючи критерій Стьюдента. Встановлено оптимальний обсяг вибірки. У першому випадку обсяг вибірки становить 50 000 літер, у другому – 30 000 фонем. Проведено атрибуцію текстів на матеріалі статистичних даних, отриманих з художніх творів Данієля Дефо "Робінзон Крузо" (XVIII ст.) та Пауліни Сари Джо Моєс "Я перед Вами" (XXI ст.). Стильову атрибуцію проведено на матеріалі статистичних даних, отриманих з газетного (The Daily Telegraph) (XXI ст.) та наукового стилів (Acta Physica Polonica) (XXI ст.). Встановлено ефективність статистичних критеріїв Лемана-Розенблатта та Стьюдента для здійснення атрибуції та стильової атрибуції текстів, визначаючи розподіл довжини слів та частоту вживання груп приголосних фонем. Результати отримано з довірчою ймовірністю 95 %. Розроблено структуру програмної системи атрибуції тексту та стильової атрибуції. Структура ґрунтується на модульному принципі. Введено модулі атрибуції текстів та стильової атрибуції. Розроблене програмне забезпечення має широкий спектр застосування. Його можна використовувати і для авторської атрибуції. Практичне застосування атрибуції текстів та стильової атрибуції здійснюється у галузі філології та у галузях, що стосуються визначення атрибуції текстів та стильової приналежності тексту. Авторська атрибуція має практичну цінність у кожній галузі людської діяльності, в якій потрібно встановити авторство тексту. Це дослідження є розширеним і доповненим щодо наших попередніх досліджень, присвяченим авторській атрибуції. https://nv.nltu.edu.ua/index.php/journal/article/view/2527атрибуція текстівстильова атрибуція текстіврозподіл довжини слівчастота вживання груп приголосних фонемкритерій Лемана-Розенблаттакритерій Стьюдента
spellingShingle І. Ю. Хомицька
В. М. Теслюк
І. Б. Базилевич
Ефективність статистичних критеріїв для визначення стильових характеристик текстів
Науковий вісник НЛТУ України
атрибуція текстів
стильова атрибуція текстів
розподіл довжини слів
частота вживання груп приголосних фонем
критерій Лемана-Розенблатта
критерій Стьюдента
title Ефективність статистичних критеріїв для визначення стильових характеристик текстів
title_full Ефективність статистичних критеріїв для визначення стильових характеристик текстів
title_fullStr Ефективність статистичних критеріїв для визначення стильових характеристик текстів
title_full_unstemmed Ефективність статистичних критеріїв для визначення стильових характеристик текстів
title_short Ефективність статистичних критеріїв для визначення стильових характеристик текстів
title_sort ефективність статистичних критеріїв для визначення стильових характеристик текстів
topic атрибуція текстів
стильова атрибуція текстів
розподіл довжини слів
частота вживання груп приголосних фонем
критерій Лемана-Розенблатта
критерій Стьюдента
url https://nv.nltu.edu.ua/index.php/journal/article/view/2527
work_keys_str_mv AT íûhomicʹka efektivnístʹstatističnihkriteríívdlâviznačennâstilʹovihharakteristiktekstív
AT vmteslûk efektivnístʹstatističnihkriteríívdlâviznačennâstilʹovihharakteristiktekstív
AT íbbazilevič efektivnístʹstatističnihkriteríívdlâviznačennâstilʹovihharakteristiktekstív