Можно ли определить текст нейросети? Почему детекторы обещают больше, чем умеют

Есть сервисы, которые предлагают почти магическую функцию.

Вставляешь текст.

Ждёшь несколько секунд.

Получаешь:

AI — 97%

И всё выглядит очень убедительно.

Можно идти ловить школьника, увольнять копирайтера, обвинять студента в мошенничестве или писать автору:

«Ха! Я так и знал, что ты сам это не писал».

Проблема в одном.

97% на экране детектора вовсе не означает 97-процентную вероятность того, что текст написал ИИ.

И уж точно не является цифровой экспертизой уровня отпечатка пальца.

Современные детекторы действительно умеют замечать некоторые характерные следы машинного текста. Иногда очень хорошо. Но между «умеет распознавать типичные образцы» и «может доказать авторство конкретного текста» лежит весьма неприятная дистанция.

Особенно теперь, когда нейросети стали писать лучше, человек может текст отредактировать, а одна модель — переписать результат другой.

Что вообще ищет AI-детектор

Никакой секретной подписи ChatGPT внутри обычного текста нет.

После копирования статьи из нейросети в WordPress между буквами не спрятано:

Generated by GPT-5. Please arrest the author.

Большинство детекторов анализируют статистические свойства текста.

Грубо говоря, они пытаются понять, насколько текст похож на тот тип текста, который обычно производят языковые модели.

Например, учитываются предсказуемость последовательностей слов, распределение вероятностей, разнообразие конструкций, повторяемость некоторых шаблонов, стилистические особенности.

У человеческого текста обычно больше странностей.

Человек может внезапно оборвать мысль.

Поставить слово, которое статистически сюда вообще плохо подходит.

Через два абзаца вспомнить, что хотел сказать раньше.

Написать:

«Ну и хрен с ним».

Модель по умолчанию чаще стремится к гладкости и вероятному продолжению.

Отсюда исторически и появилась идея:

если текст слишком статистически «правильный», возможно, его написала машина.

Работает?

Да.

Иногда.

И даже очень хорошо — если условия подходят.

На чистом машинном тексте результаты могут быть отличными

Это важно сказать, потому что было бы неправильно объявить все детекторы шарлатанством.

В контролируемых тестах хорошие системы способны очень уверенно отличать исходный машинный текст от человеческого.

Например, исследование 2025 года проверяло несколько доступных детекторов на ответах DeepSeek V3. На исходных и некоторых парафразированных текстах Copyleaks и QuillBot показывали очень высокие результаты.

То есть схема:

спросили DeepSeek → скопировали ответ целиком → отправили детектору

для некоторых систем действительно довольно удобная мишень.

Только реальные люди почему-то постоянно портят красивый лабораторный эксперимент.

Они редактируют.

Сокращают.

Добавляют свои куски.

Меняют стиль.

Переписывают фразы.

И вот после этого уверенность детектора начинает довольно быстро испаряться.

Самая простая атака на детектор — переписать текст

Ещё в работе исследователей Университета Мэриленда было показано, что последовательное перефразирование способно заметно снижать эффективность самых разных методов обнаружения машинного текста, включая нейросетевые классификаторы и даже некоторые схемы водяных знаков. Причём качество исходного текста при этом может ухудшаться совсем немного.

То есть представим:

ChatGPT написал статью.

Я отдаю её Claude:

Перепиши, сохрани смысл, сделай фразы менее предсказуемыми.

Потом сам меняю десяток предложений.

Добавляю пару историй.

Выкидываю канцелярит.

И в этот момент детектор уже проверяет не совсем тот объект, на котором его учили.

В упомянутом эксперименте 2025 года особенно хорошо сработала именно «humanization» — специальное переписывание под человеческую манеру. После него точность разных детекторов падала примерно до 71% у Copyleaks, 58% у QuillBot и 52% у GPTZero на используемой авторами выборке.

52%.

Я знаю отличный технический способ получить примерно такую же точность.

Подбросить монетку.

Разумеется, это один конкретный эксперимент, а не универсальный рейтинг этих сервисов. На других данных результаты будут другими.

Но проблема видна хорошо.

А теперь попробуем обратную ситуацию

Вот это уже неприятнее.

Что если текст написал человек, а детектор решил, что автор — нейросеть?

Это называется false positive — ложное срабатывание.

И его признают даже сами производители систем обнаружения.

Turnitin, один из самых известных инструментов в образовательной среде, сейчас вообще не показывает точный процент AI для диапазона от 1 до 19%. Вместо числа появляется специальная отметка, потому что сама компания считает этот диапазон более подверженным ложным срабатываниям.

При этом Turnitin заявляет, что для документов, где система обнаруживает более 20% AI-текста, её собственный false positive rate остаётся ниже 1%. Это показатель именно их модели, полученный на их тестировании, а не гарантия для любого текста в мире.

И даже 1% звучит совершенно по-разному в зависимости от масштаба.

Проверили десять работ?

Наверное, ничего страшного.

Проверили миллион?

Один процент — это уже десять тысяч потенциальных проблем.

Именно поэтому результат детектора нельзя превращать в автоматический приговор.

Особенно весело детекторам с необычным человеческим стилем

Исследователи давно заметили ещё одну проблему.

Человек, который пишет очень ровно, академично или на неродном языке, иногда статистически оказывается слишком похож на машину.

В ряде исследований детекторы чаще ошибочно относили тексты людей, для которых английский не является родным, к машинным. Эта проблема продолжает исследоваться и в работах 2026 года; результаты разных наборов данных отличаются, поэтому говорить, что любой детектор обязательно дискриминирует всех неносителей языка, было бы перебором. Но сама категория таких ошибок вполне реальна.

И тут получается почти комичная ситуация.

Человек старается.

Убирает разговорные конструкции.

Пишет аккуратно.

Не допускает ошибок.

Следит за структурой.

Детектор смотрит:

Подозрительно грамотный какой-то.

😁

А человек вообще умеет определить текст ИИ на глаз?

Тоже гораздо хуже, чем ему кажется.

Это отдельная проблема нашего мозга.

После того как человек несколько раз увидел классический машинный текст со словами:

«В современном быстро меняющемся мире…»

ему начинает казаться, что он уже специалист.

Дальше любой ровный текст автоматически становится:

«Ну это очевидно ChatGPT».

Исследование ACL 2025 года показало интересную вещь: люди, активно использующие ChatGPT для письма, действительно несколько иначе распознают машинные тексты, но неспециалисты склонны считать просто нейтральный стиль признаком ИИ, что приводит к ложным обвинениям.

Это я прекрасно понимаю.

Мы сами буквально недавно обнаружили пару моих любимых конструкций, которые начинают торчать из текста после десятой статьи.

Например, нейросеть действительно может иметь устойчивые речевые привычки.

Но если я запрещу ей двадцать таких конструкций, дам примеры другого стиля и прогоню текст через хорошего редактора — куда делась наша «очевидность»?

Никуда.

Человек теперь просто будет искать новые признаки.

Самое смешное — авторство текста вообще перестаёт быть бинарным

Раньше всё было удобно.

Вот текст написал Сергей.

Вот текст написала машина.

Выбираем вариант.

Сегодня реальный процесс может выглядеть так:

человек придумал тему;

ИИ собрал исследования;

человек выбрал структуру;

нейросеть сделала черновик;

человек переписал вступление;

другая модель отредактировала стиль;

человек добавил собственный опыт;

третья модель проверила факты;

человек выкинул треть текста;

ИИ предложил новый заголовок.

Ну и кто автор?

20% человек?

48% Claude?

32% ChatGPT?

Современный детектор пытается дать бинарный ответ на вопрос, который постепенно перестаёт быть бинарным.

Это примерно как спрашивать:

Эта фотография настоящая или обработанная?

А фотограф говорит:

— Снял сам. Цвет поправил Lightroom. Небо вытянул. Один мусорный бак удалил генеративным инструментом.

Так настоящая?

Ответ уже зависит от того, зачем вы вообще спрашиваете.

Может быть, нужно встроить в текст водяной знак?

Это другой подход.

Не пытаться угадывать происхождение уже готового текста по стилю, а во время генерации специально оставлять статистический след.

Например, модель немного изменяет вероятность выбора некоторых слов по скрытому правилу.

Человек ничего не замечает.

А специальный детектор потом говорит:

Да, вероятность наличия нашей сигнатуры высокая.

Теоретически это намного интереснее обычного угадывания по стилю.

Практически снова появляется человек с кнопкой:

Перефразировать.

Современные обзоры watermarking отмечают сразу несколько проблем: устойчивость к переписыванию и атакам, отсутствие общего стандарта и сложность применения одного подхода к разным генеративным системам. Поэтому водяные знаки рассматриваются как полезный инструмент происхождения контента, но не как универсальное решение.

Если текст прошёл через переводчик, редактора, другую модель и человеческую правку, сигнатура может серьёзно пострадать.

Поэтому детектор отвечает немного не на тот вопрос

Пользователь хочет узнать:

Этот конкретный текст написал искусственный интеллект?

А детектор в реальности отвечает скорее так:

По статистическим признакам этот текст похож на набор текстов, которые моя модель считает машинными.

Звучит уже не так эффектно.

На лендинге кнопку с такой надписью продавать сложнее.

Но это гораздо ближе к реальности.

Даже свежие научные работы продолжают строить всё более хорошие специализированные детекторы. Например, в 2026 году появляются модели, которые отдельно обучаются под конкретные семейства генераторов и наборы данных.

Это полезно.

Технология развивается.

Но обычно вместе с ростом качества детектора появляется новая модель генерации, новый способ перефразирования или другой домен текста.

Получается классическая гонка брони и снаряда.

Что тогда делать преподавателю или работодателю?

Точно не так:

Детектор сказал 84%. Ты мошенник.

Я бы использовал AI-detector примерно как металлодетектор.

Он запищал.

Это повод посмотреть внимательнее.

Но если охранник после каждого сигнала немедленно вызывает спецназ, проблема уже не в металлодетекторе.

Для учебной работы гораздо интереснее посмотреть историю создания документа.

Черновики.

Источники.

Способ аргументации.

Может ли автор объяснить написанное.

Почему выбрал именно эти тезисы.

Откуда взялась конкретная ссылка.

В рабочей среде вообще важнее другое:

насколько хорош итоговый результат и соблюдены ли правила использования ИИ.

Если сотруднику разрешено применять нейросети — какая разница, определил детектор 73% или 12%?

Мне гораздо интереснее, не придумал ли он цифры и не отправил ли клиенту ерунду.

А для авторского контента детектор становится почти бессмысленным

Вот возьмём наши статьи.

Предположим, текст прошёл через несколько моделей, фактчекинг и мою редактуру.

Какую полезную информацию даст цифра:

AI probability: 63%?

Что 63% предложений придумала модель?

Нет.

Что вероятность использования ИИ составляет 63%?

Тоже нет.

Что текст на 63% плохой?

Тем более.

Он просто похож на машинный по критериям конкретного алгоритма.

Качество текста таким способом вообще не измеряется.

Можно написать руками совершенно бездарную статью.

Детектор торжественно объявит:

100% HUMAN.

Поздравляю.

Теперь это доказанная человеком ерунда.

ИИ-текст всё-таки можно узнать. Иногда

Я не хочу уходить в другую крайность.

Машинный текст действительно часто выдаёт себя.

Повторы.

Слишком аккуратная структура.

Одинаковые переходы.

Избыточные выводы.

Постоянные «важно отметить».

Любовь к симметричным противопоставлениям.

Странная стерильность.

Причём у разных моделей есть свои привычки.

Но это скорее вопрос редакторского качества, а не криминалистического определения происхождения.

Плохой AI-текст часто видно.

Хорошо отредактированный — уже намного сложнее.

А хороший человеческий текст вполне способен случайно получить высокий AI-score.

Поэтому фраза:

«Я умею точно определять ChatGPT по стилю»

звучит примерно как:

«Я по фотографии всегда определяю, какая камера использовалась».

Иногда угадаете.

Иногда даже очень уверенно.

И именно во второй ситуации ошибаться особенно приятно.

Пожалуй, главный вопрос вообще другой

Для меня намного важнее не:

Написал это человек или ИИ?

А:

Кто отвечает за результат?

Если студент сдал работу, он должен понимать собственный текст.

Если журналист опубликовал факт — он отвечает за факт.

Если компания отправила клиенту коммерческое предложение — отвечает компания.

Если автор использовал нейросеть для черновика — ответственность внезапно не переехала в дата-центр OpenAI.

И мне кажется, именно к этому постепенно придётся привыкнуть.

Нейросетей в текстах будет всё больше.

Граница между «написал» и «использовал при написании» станет ещё мутнее.

Детекторы тоже будут становиться лучше, особенно в узких сценариях.

Но универсальной кнопки:

ОПРЕДЕЛИТЬ ИИ

с результатом, который можно считать доказательством, у нас пока нет.

И возможно, для обычного текста она вообще никогда не будет работать так надёжно, как нам хотелось бы.

Потому что лучший способ сделать машинный текст похожим на человеческий оказался до смешного очевидным.

Дать его человеку.