Родители современных первоклашек относительно молоды, а значит недавно они были выпускниками ВУЗов, если это так, то свежи воспоминания о «буднях студенческой жизни» и о «радостях сессии».
Нами показано как можно использовать искусственный интеллект, данный подход уберегает от генеративного текста в работе. Если генерировать работу целиком полагаясь на ИИ (найди и напиши) то маркеры генеративности наводнят так, что избавиться от них будет крайне сложно.
Нам часто задают вопрос, как убрать сгенерированный текст в антиплагиат — отвечаем со всей ответственностью…
Если вы не знаете технологии и у вас нет обучаемой нейросети как у нас, то проще и быстрей — написать новую работу методом списывания, а затем повысить ее уникальность.
Чего у вас точно нет — надежного инструмента диагностики, без разницы что вам порекомендовали — GPTZero или copyLeaks, вы не имеете инструмента диагностики генеративного текста. Мы достаточно долго, в своих предыдущих книгах серии, рассказывали про шиглы из двух слов, писали о их роли и поясняли как их можно использовать при повышении уникальности текстов. Шинлы из двух слов в мире специалистов называются биграммами — это последовательности из двух слов, соответственно шинглы из трех слов — триграммами (последовательности из трех слов), все остальные шинглы называются n-граммами. Все n-граммы находятся в НКРЯ (Национальный корпус русского языка). Их там миллионы. N-граммы это кусочки человеческих текстов, все они имеются в индексе антиплагиат.
Как GPT генерирует текст, он, конечно, опирается на некоторые n-граммы, но большую часть придумывает сам. Для GPT важно выдавать уникальный текст, потому что он проиндексировал интернет с массой авторских текстов и если он будет отдавать куски этих текстов в своих генерациях, то OpenAI засудят, хотя и сейчас он с ног до головы облеплен авторскими исками.
В чем противоречие — антиплагиат ищет в ваших текстах n-граммы человеческих текстов, а GPT эти n-граммы человеческих текстов не выдает в генерации, т.к. защищает себя от волны судебных исков.
Это ответ на вопрос, почему GPT не генерирует человеческих текстов, если говорить точней, он не генерирует тексты, которые антиплагиат ВУЗ считает человеческими. Если это понятно, идем дальше.
У человечества нет детекторов генеративного текста, то, что сегодня называют детекторами, это статистические машины, если они и имеют индекс, то индекс не равен индексу антиплагиата, поэтому точность детектирования — копеечная. Детектор легко обмануть, на рис. 71 и рис. 72 — представлен 2 текста, первый генеративный, а второй, слово в слово похож на первый, но полностью человеческий.

Рисунок 71 — Текст, 14 из 14 предложений — генеративные

Рисунок 72 — Этот же текст, 0 из 14 предложений не генеративные — это текст, который написал человек
Не смотря на простоту вопросов, общество, в лице любителей сгенерировать тексты учат навыкам, как обойти антиплагиат. Если в вашем тексте нет n-грамм человеческих текстов, то никакой антиплагиат вы не пройдете. Конечно можно написать «умный промпт-инструкцию, например замени все словосочетания из 2 слов, в моем тексте на словосочетания из 2—3 слов, которые написаны в интернет, в реальных статьях… Но такая попытка очеловечивания не даст результат. На рис. 73 текст, который мы написали методом замены n-грамм. Первое — n-грамм мало, второе, они не дают целостного понимания, что является источником первичной информации — поэтому этот текст — генеративный, в понимании антиплагиата, рис. 74.

Рисунок 73 — Замена n-грамм

Рисунок 74 — Генеративный текст
Помимо описанных нами n-грамм, современная лингвистическая статистика может применять еще множество методов. Кроме перплексии и берстности, существуют и другие показатели, которые используют детекторы генеративных текстов, рис. 75.

Рисунок 75 — Перплексия и берстность генеративного текста и текста, написанного человеком
Вот некоторые из статистических показателей, с примерными диапазонами значений для генеративного текста и текста, написанного человеком:
— Энтропия — мера неопределенности или хаоса в тексте. Чем выше энтропия, тем более случайным и непредсказуемым является текст. Для генеративного текста энтропия может быть около 4.5—5.5 бит/символ, а для текста, написанного человеком, около 3.5—4.5 бит/символ.
— Коэффициент сжатия — отношение размера сжатого текста к размеру исходного текста. Чем ниже коэффициент сжатия, тем более избыточным и повторяющимся является текст. Для генеративного текста коэффициент сжатия может быть около 0.4—0.6, а для текста, написанного человеком, около 0.2—0.4.
— Средняя длина предложения — количество слов в предложении, деленное на количество предложений в тексте. Чем больше средняя длина предложения, тем более сложным и запутанным является текст. Для генеративного текста средняя длина предложения может быть около 15—25 слов, а для текста, написанного человеком, около 10—20 слов.
— Средняя длина слова — количество букв в слове, деленное на количество слов в тексте. Чем больше средняя длина слова, тем более редкими и специфическими являются слова в тексте. Для генеративного текста средняя длина слова может быть около 5—7 букв, а для текста, написанного человеком, около 4—6 букв.
— Частота уникальных слов — отношение количества различных слов в тексте к общему количеству слов в тексте. Чем выше частота уникальных слов, тем более разнообразным и оригинальным является текст. Для генеративного текста частота уникальных слов может быть около 40—60%, а для текста, написанного человеком, около 50—70%.
— Частота стоп-слов — отношение количества общеупотребительных слов в тексте к общему количеству слов в тексте. Чем ниже частота стоп-слов, тем более информативным и содержательным является текст. Для генеративного текста частота стоп-слов может быть около 30—50%, а для текста, написанного человеком, около 20—40%.
— Частота знаков препинания — отношение количества знаков препинания в тексте к общему количеству символов в тексте. Чем выше частота знаков препинания, тем более структурированным и грамотным является текст. Для генеративного текста частота знаков препинания может быть около 5—10%, а для текста, написанного человеком, около 3—7%.
— Частота ошибок — отношение количества орфографических, грамматических и синтаксических ошибок в тексте к общему количеству слов в тексте. Чем выше частота ошибок, тем более некачественным и непрофессиональным является текст. Для генеративного текста частота ошибок может быть около 1—5%, а для текста, написанного человеком, около 0—2%.
— Частота эмодзи — отношение количества эмодзи в тексте к общему количеству символов в тексте. Чем выше частота эмодзи, тем более неформальным и эмоциональным является текст. Для генеративного текста частота эмодзи может быть около 0—2%, а для текста, написанного человеком, около 0—1%.
— Частота цитат — отношение количества цитат в тексте к общему количеству предложений в тексте. Чем выше частота цитат, тем более заимствованным и неавторским является текст. Для генеративного текста частота цитат может быть около 5—15%, а для текста, написанного человеком, около 0—10%.
— Частота ссылок — отношение количества ссылок в тексте к общему количеству слов в тексте. Чем выше частота ссылок, тем более документированным и подтвержденным является текст. Для генеративного текста частота ссылок может быть около 0—5%, а для текста, написанного человеком, около 0—10%.
— Частота аббревиатур — отношение количества аббревиатур в тексте к общему количеству слов в тексте. Чем выше частота аббревиатур, тем более специализированным и терминологическим является текст. Для генеративного текста частота аббревиатур может быть около 0—10%, а для текста, написанного человеком, около 0—5%.
— Частота иностранных слов — отношение количества слов на других языках в тексте к общему количеству слов в тексте. Чем выше частота иностранных слов, тем более многоязычным и космополитичным является текст. Для генеративного текста частота иностранных слов может быть около 0—10%, а для текста, написанного человеком, около 0—5%.
— Частота риторических фигур — отношение количества риторических фигур в тексте к общему количеству предложений в тексте. Чем выше частота риторических фигур, тем более выразительным и художественным является текст.
Как видно, тексты лучше писать самостоятельно и учить этому детей с малых лет, тогда результат будет заслуженным и предсказуемым.