Подготовка научных текстов с помощью ChatGPT: возможности, ограничения и академическая практика (фрагмент книги В. Мустакимов, А. Мустакимов, КонтрПлагиат методом перефразирования и рерайта для антиплагиат ВУЗ)

Источник: Зашихина И. М. Подготовка научной статьи: справится ли ChatGPT? // Высшее образование в России. 2023. Т. 32. №8—9. С. 24–47. DOI: 10.31992/08693617-2023-32-8-9-24-47

Перефразировано по методике КонтрПлагиат, отличие текста от источника по параметру Ш2=94%

Научные публикации представляют собой важный элемент в системе научной метрологии и выступают ключевым средством для обмена информацией между исследователями, а также между научным сообществом и обществом. Учёные вкладывают значительные усилия в подготовку статей для отправки в высокорейтинговые журналы. Авторы стремятся ускорить и упростить процесс написания статей, а также повысить его частоту, работая в коллективе и обращаясь за помощью к корректорам. Электронные инструменты, такие как Thesaurus.com, Grammarly и EndNote, существенно облегчают подбор синонимов, проверку грамматики, выполнение переводов и составление библиографических ссылок, особенно в англоязычных текстах. Академическое сообщество возлагает большие надежды на возможности, предоставляемые языковыми моделями искусственного интеллекта, особенно ChatGPT.

Модель GPT, разработанная OpenAI, представляет собой искусственный интеллект для разговорных задач, основанный на архитектуре Generative Pretrained Transformer 3 (GPT-3). Эта языковая модель, работающая на основе вероятностных алгоритмов, предсказывает следующие слова в тексте, опираясь на заданный контекст. Основная функция данной модели заключается в генерации текста в соответствии с заданным контекстом или входными данными. На основе этих языковых моделей были созданы чат-боты — компьютерные программы, использующие искусственный интеллект и обработку естественного языка для имитации человеческой беседы. Примером такого чат-бота является ChatGPT, основанный на языковой модели GPT. Его работа осуществляется следующим образом: пользователь вводит запрос или контекст (речь, текст), и ChatGPT обращается к обученной нейронной сети для генерации ответа. Запрос может быть сформулирован на любом языке, и система ответит на языке запроса.

ChatGPT, инновация 2022 года от OpenAI, привлекла значительное внимание специалистов и осведомленных пользователей интернета. Его производительность, в частности потенциал инноваций и социокультурное влияние, часто сравнивают с влиянием самого интернета. ChatGPT понимает естественный язык и способен генерировать текст на многих языках, включая русский. Модели, такие как GPT, обучаются на огромных массивах данных, взятых из интернета, что делает отслеживание источников практически невозможным. Тексты, генерируемые ChatGPT, основаны на существующей литературе. Чат-боты могут предоставлять информацию по широкому спектру дисциплин, включая математику, медицину, географию, искусство и лингвистику, что делает эту модель универсальным инструментом для решения разнообразных задач.

В процессе многократного усовершенствования модели GPT были улучшены алгоритмы обучения и расширены объемы данных. GPT-4, обладая высокой адаптивностью, демонстрирует значительное увеличение скорости работы и углубленное семантическое понимание. Среди особенностей этой модели выделяются языковая чувствительность, информационная полнота, креативность, улучшенная связность текста и расширенные возможности для программирования сложных задач. 1 марта 2023 года была представлена GPT-3.5, а 14 марта 2023 года — GPT-4. Существенным отличием GPT-4 является поддержка не только текстовой информации, но и изображений, включая фотографии, скриншоты и модели. По информации с сайта OpenAI, практические различия между GPT-3.5 и GPT-4 в повседневном использовании минимальны. Обе модели были обучены на наборах данных, актуальных до сентября 2021 года.

Функционал ChatGPT включает в себя написание кода, разработку простых приложений, поиск информации, перевод на различные языки и решение задач. Имеются документированные примеры научных работ и статей, созданных с использованием этого инструмента. Способность ChatGPT генерировать научные тексты вызвала широкий резонанс и множество откликов в социальных сетях по всему миру. Многие видят в этой технологии огромный потенциал. Встает вопрос о ценности научных текстов, созданных ИИ: будет ли ChatGPT способствовать написанию значимых научных статей с проверенными данными и высоким уровнем значимости? Этот вопрос является основным в данном исследовании. Целью этой работы является оценка способности ChatGPT создавать вступления к научным статьям, посвященным актуальным проблемам современности.

Научные работы, касающиеся теории ChatGPT, начали появляться уже в 2023 году, вскоре после запуска программы. Если в начале 2023 года большинство публикаций касательно использования ChatGPT были препринтами и относились к серой литературе, то в настоящее время имеется значительное количество экспертных статей на эту тему. В данных публикациях признаются функциональные возможности ChatGPT. ChatGPT представляет собой надежный и перспективный инструмент для автоматизированного создания различных типов текстов: резюме, научных статей, писем и рекламных постов. Модель искусственного интеллекта генерирует оригинальные, разнообразные и интересные тексты, стимулируя креативность и воображение авторов. Кроме того, ChatGPT способствует генерации новых идей, гипотез, вопросов и мнений, которые авторы могут исследовать. Программа легко переводит тексты на большинство современных языков и анализирует огромные объемы данных. Важно отметить, что модель ускоряет процесс написания академических и научных работ, особенно для студентов и начинающих исследователей. ChatGPT позволяет носителям неанглийских языков более эффективно публиковать и получать доступ к научной литературе. Программа способна писать хорошо структурированные студенческие работы, резюмировать академические статьи, давать ответы, достаточные для сдачи медицинских экзаменов, и генерировать полезный компьютерный код. Она извлекает ключевые моменты из длинных текстов и предоставляет цитаты по запросу, экономя исследователям значительное количество времени и усилий, позволяя им сосредоточиться на более важных задачах, таких как анализ и интерпретация. ChatGPT также обладает многочисленными приложениями в научных и академических публикациях, включая поиск журналов, форматирование в соответствии со стилем журналов, контроль процесса рецензирования и проверку на соответствие этическим и техническим требованиям. Существует мнение, что статьи, сгенерированные ботом, превосходят среднее качество студенческих текстов уровня докторантуры.

Тем не менее ученые часто подчеркивают риски, связанные с использованием ChatGPT. Они указывают на то, что ChatGPT не является полностью надежным инструментом. Хотя он может создавать достоверные научные работы, данные, которые он генерирует, часто представляют собой смесь реальной и сфабрикованной информации. Программа не всегда точно отвечает на запросы. Тексты, создаваемые искусственным интеллектом, могут быть поверхностными, неглубокими и содержать ложные ссылки и выводы. Иногда предоставляются взаимоисключающие ответы. Без предварительного знания вопроса невозможно определить, какой сценарий является правильным. Существует корреляция между длиной ответов и долей неточных данных, сгенерированных ChatGPT. Модель может создавать тексты, включающие народные знания, научные факты или общие сведения, однако она не в состоянии оценить, является ли идея инновационной, перспективной или ошибочной. Роботы не способны понимать новую информацию, генерировать и анализировать идеи. Использование ChatGPT становится проблематичным, когда отсутствует возможность оценить результаты, предоставленные программой, например, при переводе текста на незнакомый язык. Неоднозначные термины, термины с несколькими значениями и составные термины могут создавать проблемы при интерпретации смысла. ChatGPT неспособен оценить значимость конкретного факта или идеи для развития, используя показатели социальных, экономических и культурных изменений.

Проблема, которая вызывает наибольший отклик у пользователей при взаимодействии с ChatGPT, связана с явлением, известным как проблема искусственной иллюзии. Искусственные галлюцинации возникают, когда машина, например, чат-бот, создает видимые, но ложные переживания, не соответствующие реальным данным. Эти галлюцинации могут проявляться в различных формах, включая визуальные и слуховые искажения. Часто связи, которые устанавливаются ботами между концепциями, их источниками и областями применения, оказываются некорректными. Эти ошибочные выводы могут неверно приписывать авторство идеи или некорректно характеризовать концепцию, основанную на определенном методе или контексте. Эта проблема особенно значима при создании проверяемых научных текстов.

Исследование, опубликованное в журнале Cureus (PubMed), тщательно анализировало качество ссылок на источники, предоставляемых чат-ботами, такими как ChatGPT. Анализ показал, что из 178 проверенных ссылок 69 не имели цифрового идентификатора объекта (DOI), а 28 ссылок не отображались в результатах поиска Google и не имели существующего DOI. Эти наблюдения свидетельствуют о том, что способность ChatGPT генерировать надежные ссылки для исследовательских целей может быть ограничена доступностью DOI и онлайн-статей.

Многие университеты и научные исследователи по всему миру выразили обеспокоенность по поводу возможного влияния ChatGPT на научную коммуникацию. Существует мнение, что использование программы может снизить количество революционных научных открытий в будущем. Искусственно-интеллектуальные языковые боты не обладают креативностью и экспертностью, необходимыми для таких прорывов. Особую тревогу выразили представители медицинского сообщества. Если медицинские ученые начнут полагаться на языковые чат-боты для публикации неверных данных, например, об эффектах лекарств, такие публикации могут иметь опасные последствия. Данные ChatGPT о массовом использовании лекарств могут не учитывать противопоказания, что может нанести непоправимый вред пациентам.

В научном сообществе также возникли вопросы о том, заменит ли ChatGPT академических исследователей. Насколько легко рецензенты, редакторы, журналы и издатели могут быть обмануты поддельными статьями? В 2013 году газета The Guardian описала расследование научного журналиста Джона Боханнона. На протяжении десяти месяцев Боханнон отправлял фиктивную научную статью в 304 журнала открытого доступа по всему миру. Статья, которая была фундаментально ошибочной и содержала сфабрикованный контент, авторов и учреждения, была принята 157 журналами, включая известные издания от Sage, Elsevier и Wolters Kluwer.

Мнения ученых о полезности ChatGPT для написания научных работ разделились: одна часть полагает, что программа способна генерировать значительные фрагменты текста, если не весь текст целиком. Данные ученые обсуждают потенциал ИИ в оптимизации процесса создания и написания текстов, улучшении производительности и обогащении содержательной части. Особенно важным является роль робота в решении одной из самых сложных задач — формулирования гипотезы и начала исследования, предоставляя существенную помощь начинающим исследователям. В этом контексте ChatGPT выступает в роли катализатора, мотивируя молодых ученых к началу их исследовательской деятельности. Программа помогает создавать рукописи, исследовательские предложения, грантовые заявки и наброски отчетов, закладывая основу и обеспечивая включение ключевых компонентов текста. Этот вид поддержки искусственного интеллекта включает функции энергосбережения и оперативного предоставления начальной информации при ограниченных временных ресурсах.

Б. Лунд и коллеги утверждают, что ChatGPT упрощает процесс написания научных работ, структурируя основную тему на подтемы и назначая GPT для подготовки каждого раздела. ChatGPT хорошо воспроизводит разделы научных исследований, основанные на существующих знаниях и теоретических основах; М. Ньюман отмечает, что эти разделы часто включают введение, теоретические основы, обзор литературы и методологическое описание. Лунд и его соавторы утверждают, что ИИ позволяет авторам ссылаться на многочисленные источники через ChatGPT, что способствует расширению использования чужих работ в научных статьях. При предоставлении исследователями исчерпывающей методологической информации, ChatGPT помогает создавать соответствующую методологию, усиливать гипотезы, выявлять потенциальные предубеждения и ограничения, а также повышать валидность и надежность исследований. Алгоритмы ИИ быстро создают организованные и визуально приятные результаты, такие как графики и таблицы, подходящие для включения в рукописи.

Авторы подчеркивают, что ChatGPT обладает значительным потенциалом для создания научных текстов. Обобщая возможности ChatGPT, ученые указывают, что программа способна генерировать первоначальные идеи, писать введение без постановки проблемы, исследования пробелов и ссылок на источники, обобщать информацию в виде обзора литературы, хотя интеграция и всестороннее освещение проблемной области не гарантируются. При предоставлении полной информации о методологии и транскрибированных данных, ChatGPT может представить обзор методологии исследования и проводить качественный анализ данных при подготовке результатов исследования.

Эти функции делают ChatGPT полезным инструментом для научной документации, оказывая помощь исследователям на различных этапах их работы.

Еще одним направлением применения ChatGPT в создании научных текстов является выполнение механических расчетов, перевод материалов между языками, проверка данных и рецензирование итогового текста. К примеру, алгоритмы искусственного интеллекта могут рекомендовать включение ранее выполненных релевантных исследований в введение научной статьи или добавление ограничений в раздел обсуждения. Системы искусственного интеллекта функционируют как статистические калькуляторы, способные незамедлительно выполнять расчеты, часто требуемые в рамках научных исследований. ChatGPT эффективно обнаруживает механические ошибки в текстах. Кроме того, программа способна переводить списки литературы на другие языки. Возможности редактирования программы способствуют экономии времени, позволяя исследователям сосредоточиться на содержательной части текста.

Тем не менее, специалисты, рассматривающие возможности искусственного интеллекта, часто подчеркивают ограничения использования ChatGPT при создании научных текстов. Одна из частых претензий к чат-ботам с искусственным интеллектом заключается в необходимости составления подлинного обзора литературы с оригинальными ссылками; ChatGPT неспособен устанавливать связи между результатами различных исследований, что исключает возможность написания обзора литературы исключительно с помощью искусственного интеллекта. Результаты исследований показывают, что ChatGPT не всегда является надежным источником для обзоров литературы, особенно в узкоспециализированных областях с небольшим количеством публикаций. Большинство ссылок, сгенерированных GPT-3, оказались ошибочными.

Более того, в тексте, создаваемом ИИ, отсутствует точка зрения автора. Боты последовательно и без акцента предоставляют различные мнения по обсуждаемой теме. Пользователи программы отметили, что текст не отражает позицию автора по исследуемому вопросу; ChatGPT не способен выявить пробелы в исследовательских областях. Авторы выразили недовольство аннотациями, подготовленными ИИ. Результаты исследования показали, что несмотря на ясность изложения, только 8% аннотаций соответствовали требованиям форматирования конкретного журнала. ChatGPT не может собирать качественные данные из личных интервью, интервью с ключевыми информаторами и фокус-групповых обсуждений. Инструмент не способен загружать файлы данных, что делает невозможным проведение эмпирических анализов. Кроме того, если поисковый запрос формулируется неправильно, ответы чат-бота могут оказать негативное влияние на результаты научного исследования.

Ответы, предоставляемые чат-ботами, часто считаются стереотипными. Предвзятость ответов может быть опасной; Р. Дейл отметил, что боты могут многократно утверждать превосходство одной расы над другой. Э. Бендер и его коллеги развили эту идею, указав, что любой язык по своей природе содержит коммуникативные намерения людей. Использование языка позволяет человеку выразить свое мировоззрение. Мировоззрение, которое Соссюр обозначил как «картину мира», передается через язык и включает в себя предрассудки людей, которые говорят на этом языке. Тексты, на основе которых тренируется нейронная сеть ChatGPT, в основном представляют западные общества. Обучающие данные содержат мало информации о мировоззрении других культур. Таким образом, информация о других культурах, например о людях из Африканской Республики, может искажаться в ответах ChatGPT.

Исследование, проведенное Э. Бендер и её коллегами, выявляет примеры оскорбительного языка, предвзятости, связанной с полом, нетерпимости, микроагрессий, дегуманизации и целого ряда социально-политических предвзятостей, присутствующих в лингвистических данных, используемых ChatGPT. В качестве иллюстрации можно привести пример использования термина «истеричный» для описания рассказов женщин о переживаниях, связанных с сексизмом, что указывает на нормализацию такого поведения и подчеркивает стереотипы, представляющие женщин как эмоционально неустойчивых и несостоятельных личностей.

Б. Кутела и его команда делятся своим опытом применения ботов для создания научных текстов. Конкретно, они описывают задачу, поставленную перед ChatGPT, следующим образом: «Я намерен разработать введение для научной публикации. Предоставлю несколько заголовков. Текст должен быть составлен высококвалифицированным специалистом в области безопасности дорожного движения, включать фактические ссылки, точные данные и статистику по безопасности дорожного движения». Согласно мнению клиента, варианты введения, подготовленные ChatGPT, существенно отличаются от тех, что созданы людьми.

Ключевой проблемой, связанной с использованием ChatGPT для написания научных статей, является вопрос авторства. В академической практике цитирование источников подразумевает, что автор обладает компетенцией в своей области, демонстрируя осведомленность о существующих исследованиях по конкретной теме. Цитирование также служит знаком уважения к работе других исследователей, предоставляя признание их идеям и открытиям, использованным в работе автора. Результаты, полученные от компьютерной программы, представляют собой совокупность знаний мирового научного сообщества и всех опубликованных авторов, однако эти результаты не могут быть приписаны конкретным авторам текстов, созданных ChatGPT. Более того, остаётся неясным, кто несёт ответственность за публикацию текстов, созданных ИИ, что вызывает обеспокоенность по поводу правомочности авторов и затрагивает все слои научного сообщества: авторов статей, редакторов журналов и, возможно, читателей, которые могут чувствовать себя обманутыми.

Редакция престижного журнала Science запретила использование текстов, созданных ChatGPT и другими инструментами ИИ, в публикуемых статьях. Это решение подчеркивает необходимость мониторинга роли ИИ в академических исследованиях и внедрения строгих правил в научные журналы, запрещающих использование ИИ при написании рукописей. Рекомендуется ввести процедуры экспертной оценки публикуемой информации в научных журналах. Важно отметить, что плагиат не ограничивается только копированием текста, но включает также перефразирование содержимого, методов, диаграмм, идей и любой другой интеллектуальной собственности, принадлежащей другим лицам. Критики плагиата утверждают, что ChatGPT должен ориентироваться на рецензируемые академические источники и проявлять скептицизм к неакадемическим источникам для обеспечения точности и надежности своих ответов. Если авторы решают использовать ChatGPT, рекомендуется включать в текст научных статей отказ от ответственности, подтверждая использование искусственного интеллекта в процессе создания материала.