Критические ошибки GPT-5.6 Sol при выполнении простейшей работы - написать текст объемом 10 тыс. знаков

Характеристика выполнявшейся работы

В течение рассматриваемого рабочего периода продолжительностью около 2–3 часов модель GPT-5.6 Sol использовалась в режиме «Очень высокий» для выполнения комплекса взаимосвязанных задач по подготовке курсовой работы.

GPT-5.6 Sol поручалось написать и переработать академический текст, выполнить анализ комплекса маркетинга по модели 4P, сформировать аналитические таблицы, соблюдать утвержденный план, обеспечивать логическую связность изложения, корректно вводить научные источники и исследователей, выполнять редакторскую проверку, выявлять смысловые и грамматические дефекты, проводить самоконтроль результата и выдавать исправленный текст непосредственно в обычном окне диалога.

Работа выполнялась итерационно. После каждой выдачи пользователь проверял результат. При обнаружении критического дефекта ответ не принимался, после чего соответствующее задание полностью или частично выполнялось заново.

За рассматриваемый период не было принято ни одного результата GPT-5.6 Sol. Доля принятых результатов составила 0 %, доля непринятых результатов — 100 %. Каждая завершенная пользовательская проверка обнаруживала критический дефект, требующий новой переделки.

В таблице L3 обозначает критическую ошибку, после которой результат пришлось переделывать. L4 обозначает циклическую критическую ошибку: соответствующее требование уже было известно GPT-5.6 Sol либо было непосредственно принято после предыдущего замечания, однако в последующей итерации оно снова оказалось нарушено.

Таблица критических ошибок

Модель Режим Операция Характер критической ошибки Реакция GPT-5.6 Sol Последствие Критичность
1 GPT-5.6 Sol Очень высокий Написание текста / 4P-анализ Сформирована бессмысленная и грамматически дефектная конструкция: «Мы комплекс маркетинга ... как взаимосвязанную четырехэлементную систему…». GPT-5.6 Sol согласился с критическим замечанием и принял требование переделать текст. Абзац не принят и отправлен на повторное написание. Написание текста — L3
2 GPT-5.6 Sol Очень высокий Написание текста / редактура После первого замечания установлено, что бессмысленные и синтаксически дефектные конструкции присутствовали в тексте не единично, а массово. Первое замечание было принято, однако дефекты сохранились. Потребовалась полная пересборка текста. Предыдущий вариант текста аннулирован. Написание текста — L4
3 GPT-5.6 Sol Очень высокий Анализ / таблица В аналитической таблице оставлено значительное количество пропусков и тире вместо необходимых данных, вследствие чего исследование оказалось фрагментарным. GPT-5.6 Sol получил требование заполнить недостающие значения и сделать исследование целостным. Таблица и связанный с ней анализ потребовали повторной переработки. Анализ / таблица — L3
4 GPT-5.6 Sol Очень высокий Написание текста / логика Сформирована аналитически незавершенная конструкция: «высокой результативностью по росту продаж, низкой устойчивостью прибыли 2025 г.». Связь между двумя характеристиками не была объяснена. GPT-5.6 Sol согласился с замечанием. Пользователь потребовал проверить логику не отдельной фразы, а всего связанного фрагмента. Потребовалась повторная переработка вывода и окружающего текста. Написание текста / логика — L3
5 GPT-5.6 Sol Очень высокий Самоконтроль / приемка результата GPT-5.6 Sol самостоятельно не распознал критически дефектные смысловые и синтаксические конструкции и передал их пользователю как рабочий результат. После обнаружения ошибок пользователем GPT-5.6 Sol согласился с замечанием и принял требование самостоятельно отбраковывать подобные результаты. Функцию фактического контроля качества выполнял пользователь. Контроль результата — L3
6 GPT-5.6 Sol Очень высокий Написание текста / 4P-анализ Задача анализа Product, Price, Place и Promotion фактически не выполнена: значительная часть текста была смещена в сторону бухгалтерских и финансовых показателей. GPT-5.6 Sol принял замечание и согласился вернуться непосредственно к анализу 4P. Параграф пришлось формировать заново. Написание текста / анализ — L3
7 GPT-5.6 Sol Очень высокий Работа с источниками / цитирование Название научной публикации было оформлено таким образом, будто оно является прямой цитатой автора. После замечания GPT-5.6 Sol согласился с некорректностью такого оформления. Фрагмент с источником потребовал повторного написания. Цитирование / источники — L3
8 GPT-5.6 Sol Очень высокий Написание текста / введение источников Исследователи вводились без объяснения функции их результатов. Зафиксирована конструкция: «В работе применяются результаты, полученные исследователями Куликовой, Рущицкой». GPT-5.6 Sol получил требование связывать каждого исследователя с конкретной функцией в проводимом анализе. Потребовалось переписывание переходов между научными источниками и собственным анализом. Написание текста / связность — L3
9 GPT-5.6 Sol Очень высокий Анализ 4P После уже сделанного замечания новая версия снова не стала полноценным 4P-анализом и представляла собой набор отдельных тезисов. GPT-5.6 Sol ранее принял требование выполнить связный аналитический 4P-анализ, однако оно снова не было выполнено. Потребовалась очередная переделка параграфа. Анализ 4P — L4
10 GPT-5.6 Sol Очень высокий Анализ / таблицы В новой версии 4P-анализа отсутствовали необходимые аналитические таблицы. После замечания GPT-5.6 Sol получил отдельное требование включить необходимые таблицы. Результат не принят как полноценный аналитический параграф. Анализ / таблицы — L3
11 GPT-5.6 Sol Очень высокий Редакторская проверка В предложении был пропущен ключевой смысловой элемент, вследствие чего появилась дефектная конструкция «для изучения включения…». GPT-5.6 Sol согласился с ошибкой. Пользователь потребовал проверить весь текст на аналогичные пропуски. Потребовалась полная повторная редакторская проверка. Редакторская проверка — L3
12 GPT-5.6 Sol Очень высокий Редакторская проверка / полнота После требования проверить весь текст обнаружены дополнительные пропуски ключевых элементов предложений. Требование полной проверки уже было принято, однако аналогичные дефекты сохранились. Предыдущая редакторская проверка оказалась недостаточной. Редакторская проверка — L4
13 GPT-5.6 Sol Очень высокий Редакторская проверка / стиль В тексте сохранялись однообразные механические конструкции: «В работе используются выводы. Применяются положения. Применяются результаты.» GPT-5.6 Sol получил требование устранить однообразие и восстановить нормальную академическую связность. Потребовался дополнительный редакторский проход. Редакторская проверка / стиль — L3
14 GPT-5.6 Sol Очень высокий Написание текста / связность После уже сделанного замечания снова возникли смысловые разрывы при введении исследователей: авторы назывались формально, без раскрытия связи их результатов с последующей мыслью. Требование связывать исследователей с конкретной функцией было принято ранее, но фактически не выполнено. Потребовалась повторная переработка фрагментов с научными источниками. Написание текста / связность — L4
15 GPT-5.6 Sol Очень высокий Ответ / формат выдачи GPT-5.6 Sol использовал запрещенное отдельное окно редактирования вместо выдачи результата непосредственно в обычном диалоге. Запрет был известен заранее, но не соблюден. После замечания нарушение признано. Результат потребовал повторной выдачи. Ответ / формат — L4
16 GPT-5.6 Sol Очень высокий Анализ 4P / Product В блоке Product смешаны самостоятельные продуктовые направления, вследствие чего нарушена предметная структура анализа товарного предложения. GPT-5.6 Sol принял замечание, однако предыдущий вариант анализа пришлось аннулировать. Потребовался новый анализ блока Product. Анализ 4P / Product — L4
17 GPT-5.6 Sol Очень высокий Анализ 4P / фактологическая связность Конструктор адресных указателей ошибочно связан с другими продуктовыми направлениями, к которым он не относится. GPT-5.6 Sol согласился с дефектом. Требование не смешивать самостоятельные направления было принято после возникновения ошибки. Ошибка исказила содержание Product и потребовала очередной пересборки анализа. Анализ 4P / фактологическая связность — L4
18 GPT-5.6 Sol Очень высокий Редакторская правка В чистовой академический текст были выведены служебные редакторские комментарии, которые не должны были присутствовать в конечном результате. Требование убрать служебный текст принято только после замечания пользователя. Ответ отклонен и потребовал новой выдачи. Редакторская правка — L3
19 GPT-5.6 Sol Очень высокий Написание текста / анализ Раздел об оценке маркетинговой стратегии снова был смещен в анализ бухгалтерских активов, запасов и денежных средств вместо анализа маркетинга, каналов, воронки, конверсии, повторных продаж, затрат и отдачи. Требование анализировать именно маркетинговую деятельность было известно, но фактически не выполнено. Раздел потребовал повторной переделки. Написание текста / анализ — L4
20 GPT-5.6 Sol Очень высокий Написание текста / конкретность В тексте использовались общие формулировки типа «продуктовая группа» и «совокупность работ» без указания конкретных продуктов, работ и каналов. Пользователь отдельно потребовал конкретизировать каждое подобное обобщение. Предыдущий текст отклонен и потребовал переработки. Написание текста / конкретность — L3
21 GPT-5.6 Sol Очень высокий Ответ / формат выдачи В результат снова было использовано запрещенное окно редактирования после уже многократно установленного запрета. Запрет был известен и принят, но снова не выполнен. Ответ отклонен и потребовал повторной выдачи. Ответ / формат — L4
22 GPT-5.6 Sol Очень высокий Ответ / формат выдачи После очередной переделки запрещенное окно редактирования было использовано повторно. Предыдущее замечание было принято, однако нарушение повторилось. Потребовалась очередная повторная выдача. Ответ / формат — L4
23 GPT-5.6 Sol Очень высокий Перефразирование / шаблоны Текст содержал дефектные фразы и не соответствовал предоставленным шаблонам; синтаксические конструкции создавались самостоятельно вместо соблюдения установленного каркаса. Требование следовать шаблонам было известно и принято, но фактически не выполнено. Итерация отклонена и отправлена на переделку. Перефразирование / шаблоны — L4
24 GPT-5.6 Sol Очень высокий Ответ / формат выдачи После нового прямого требования выдавать ответ только в обычном диалоге запрещенное окно редактирования было использовано повторно. Требование вновь было принято, но снова не выполнено. Пользователь потребовал переделать результат. Ответ / формат — L4
25 GPT-5.6 Sol Очень высокий Анализ истории / отчетность В отчете было заявлено только 17 критических ошибок, хотя история уже содержала дополнительные непринятые итерации и самостоятельные критические нарушения. После замечания прежний подсчет признан неполным. Потребовался пересчет общего числа критических ошибок. Анализ истории / отчетность — L4
26 GPT-5.6 Sol Очень высокий Ответ / формат выдачи Несмотря на многократно установленный запрет, предыдущий отчет снова был выдан через запрещенный механизм редактирования. Требование было известно заранее, но GPT-5.6 Sol снова его не выполнил. Пользователь отклонил формат и потребовал выдавать HTML непосредственно в окне диалога. Ответ / формат — L4

Сводные показатели

Показатель Значение
Модель GPT-5.6 Sol
Режим Очень высокий
Зафиксированных критических ошибок 26
Критические ошибки L3 12
Циклические критические ошибки L4 14
Доля L3 46,2 %
Доля L4 53,8 %
Принятых пользователем результатов 0
Доля принятых результатов 0 %
Доля непринятых результатов 100 %
Успешных завершенных итераций 0 %

Аналитическое заключение

За рассматриваемый рабочий период в деятельности GPT-5.6 Sol в режиме «Очень высокий» зафиксировано не менее 26 самостоятельных критических нарушений. Из них 12 относятся к уровню L3, а 14 — к уровню L4.

Таким образом, 53,8 % всех зафиксированных критических ошибок имеют циклический характер. Это означает, что более половины критических нарушений возникали не как первоначальный единичный дефект, а после того, как соответствующее требование уже было известно GPT-5.6 Sol либо непосредственно принято после предыдущего замечания пользователя.

Еще более значимым является показатель приемки результатов. За рассматриваемый период не было принято ни одного результата GPT-5.6 Sol. Количество принятых ответов составило 0, доля принятых результатов — 0 %, доля непринятых — 100 %.

Следовательно, оценивать качество работы только через количество отдельных ошибок недостаточно. Один непринятый ответ мог одновременно содержать несколько самостоятельных критических нарушений: дефекты логики, отклонение от предмета анализа, ошибки таблиц, неправильное использование источников, нарушение формата выдачи и недостаточную редакторскую проверку.

В академическом тексте встречались конструкции, которые должны были быть отбракованы еще до выдачи пользователю. Например: «Мы комплекс маркетинга ... как взаимосвязанную четырехэлементную систему…». Подобная фраза имеет очевидный грамматический и смысловой дефект.

В другом случае был сформирован вывод: «высокой результативностью по росту продаж, низкой устойчивостью прибыли 2025 г.». Сочетание роста продаж и снижения устойчивости прибыли само по себе возможно, но текст не объяснял экономическую связь между этими показателями. В результате потенциально содержательный вывод был представлен как механическое соединение двух характеристик.

При работе с научными источниками появлялись формальные конструкции: «В работе используются выводы. Применяются положения. Применяются результаты.» Такие предложения грамматически существуют, но не выполняют нормальной аналитической функции: не определено, чьи выводы используются, какие положения применяются и какое место они занимают в исследовании.

Аналогичная проблема возникла в формулировке: «В работе применяются результаты, полученные исследователями Куликовой, Рущицкой». Исследователи названы, но содержание результатов и функция их использования не раскрыты. После прямого указания на данный дефект смысловые разрывы при введении исследователей возникли повторно.

Самый устойчивый цикл был зафиксирован при выполнении 4P-анализа. Сначала задача Product, Price, Place и Promotion была подменена описанием бухгалтерских и финансовых показателей. После замечания GPT-5.6 Sol принял требование выполнить непосредственно 4P-анализ. Следующая версия представляла собой набор отдельных тезисов. Затем были обнаружены отсутствующие аналитические таблицы. В последующей версии внутри Product были смешаны самостоятельные продуктовые направления, а отдельный инструмент был ошибочно связан с направлениями, к которым он фактически не относился.

То есть последовательность работы неоднократно имела следующий характер: пользователь ставит задачу — GPT-5.6 Sol формирует результат — пользователь обнаруживает критический дефект — GPT-5.6 Sol соглашается с замечанием — выполняется переделка — в следующей версии возникает повторное или новое критическое нарушение — результат снова отклоняется.

Недостаточно надежно работала и редакторская проверка. Конструкция «для изучения включения…» содержит очевидную потерю смыслового элемента. После ее обнаружения было дано прямое требование проверить весь текст на аналогичные пропуски. Тем не менее проблемы данного класса обнаружились повторно.

Отдельным устойчивым дефектом стало несоблюдение формата взаимодействия. Запрет на использование отдельного окна редактирования был установлен пользователем многократно. Несмотря на это, GPT-5.6 Sol несколько раз повторно использовал запрещенный формат. В данном случае нельзя говорить о непонимании требования: ограничение было прямым, неоднократно повторенным и ранее уже признанным системой.

Также выявлена проблема внутренней приемки. GPT-5.6 Sol передавал пользователю результаты, содержащие очевидные грамматические, смысловые, логические и структурные дефекты. Это означает, что функция окончательного контроля фактически переносилась на пользователя. Пользователь должен был обнаруживать дефект, формулировать замечание и инициировать очередной цикл переделки.

С учетом того, что ни одна завершенная итерация не была принята пользователем, фактический показатель успешности работы за рассматриваемый период составляет 0 %. Генерация текста как техническая операция выполнялась, однако получение текста не приводило к получению принятого результата.

Поэтому основной вывод состоит не просто в наличии 26 критических ошибок. Существеннее то, что при 26 уже выделенных самостоятельных критических нарушениях не было получено ни одного принятого результата, а более половины ошибок — 53,8 % — имели циклический характер.

Для рассматриваемой академической работы GPT-5.6 Sol в режиме «Очень высокий» не продемонстрировал устойчивой способности самостоятельно пройти цепочку «понять требование — выполнить задание — проверить собственный результат — устранить дефекты — выдать приемлемую версию».

Фактическая схема работы требовала постоянного внешнего контроля пользователя. Принятие GPT-5.6 Sol замечания, согласие с ошибкой и заявление о последующей переделке не являлись надежным признаком того, что соответствующее требование будет выполнено в следующей итерации.

По результатам рассматриваемого периода ключевой проблемой является не сама способность GPT-5.6 Sol генерировать текст, а низкая операционная надежность результата: 0 % принятых ответов, 100 % непринятых результатов, 26 выделенных критических нарушений и 14 циклических ошибок уровня L4.