Как пользоваться
- Вставьте текст от 150 слов — короче статистика не набирается, и инструмент честно скажет, что оценивать нечего.
- Оценка появится сама: процент в моно, шкала и вердикт «скорее человек / неясно / признаки ИИ».
- Ниже — таблица метрик: значение, норма для живого текста и комментарий, в какую сторону метрика тянет.
- В блоке текста подсвечены найденные фразы-маркеры («важно отметить», «в современном мире», «delve», «tapestry»); их полезно вычистить, даже если текст ваш.
Как работает детектор
Полноценные детекторы вроде GPTZero считают perplexity — насколько текст предсказуем для языковой модели. В браузере без модели это невозможно, поэтому инструмент опирается на статистические признаки, которые коррелируют с машинным текстом. Главный — burstiness: коэффициент вариации длины предложений. Люди пишут неровно: короткая фраза, потом длинная на три строки; модели выдают предложения близкой длины. Дальше — разнообразие словаря (TTR и MATTR по окнам в 50 слов), энтропия слов и биграмм, доля пассивных конструкций, однородность абзацев по длине, частота эм-тире и конструкций «— это», «правило трёх» (перечисления ровно из трёх элементов), отсутствие первого лица и «человеческого мусора» — скобок, эмодзи, многоточий, сленга, опечаток-двойных пробелов.
Отдельный слой — словарь фраз-маркеров, характерных для ChatGPT и его родственников: по-русски «в современном мире», «важно отметить», «играет ключевую роль», «представляет собой», «является неотъемлемой частью», «давайте разберёмся», «в заключение»; по-английски «delve», «tapestry», «testament to», «it's important to note», «in today's fast-paced world», «not only … but also», «leverage», «seamless», «robust». Каждая метрика сдвигает итог на несколько пунктов от нейтральных 50%.
Почему детекторы ошибаются
- Формальный человеческий текст (юридический, научный, пресс-релиз) выглядит «машинно»: ровные предложения, пассив, никакого первого лица. Ложные срабатывания на нём — норма для любого детектора, включая коммерческие.
- Отредактированный ИИ-текст с вычищенными маркерами и переставленными предложениями проходит как человеческий. Метрики ловят ленивую генерацию, а не старательную.
- Переводы и тексты не-носителей часто «ровнее» и беднее словарём — детектор тянет их к ИИ.
- Короткие тексты дают шум: на 100 словах коэффициент вариации ничего не значит, поэтому ниже 150 слов оценка не выдаётся.
Зачем это арбитражнику
Модерация Facebook, Google Ads и Яндекс Дзена, редакции площадок для гостевых постов и биржи контента всё чаще прогоняют тексты через детекторы. Прокладки, прелендинги и SEO-статьи, написанные нейросетью «как есть», получают отказ или пессимизацию как шаблонные. Инструмент показывает, какие именно признаки выдают генерацию: где выровнять ритм предложений, какие обороты вычистить, где добавить конкретики и первого лица. Это дешевле, чем узнать о проблеме после отклонения кампании.
Частые вопросы
Насколько точен детектор ИИ-текста?
Это эвристика: на очевидных случаях (сырой ChatGPT против живого поста) она работает уверенно, на формальных человеческих текстах и отредактированной генерации ошибается. Результат — повод присмотреться, а не доказательство. Ни один детектор, включая платные, не даёт юридически значимого ответа.
Что такое burstiness и perplexity?
Perplexity — мера предсказуемости текста для языковой модели: у ИИ-текста она ниже. Burstiness — неравномерность: разброс длины предложений и слов. Люди пишут «рывками», модели — ровно. Здесь считается burstiness и статистические заменители perplexity: энтропия слов и биграмм, разнообразие словаря.
Почему нужен текст от 150 слов?
Коэффициенты вариации и энтропия на коротком тексте — шум: три предложения могут быть ровными случайно. От 150 слов статистика становится осмысленной, от 300 — устойчивой.
Работает ли детектор с английским текстом?
Да, язык определяется автоматически. Для английского применяются свой список маркеров («delve», «tapestry», «testament to», «in conclusion»), своя эвристика пассива (be + причастие) и свой список первого лица и сленга.
Отправляется ли текст на сервер?
Нет. Все метрики считаются JavaScript-кодом в браузере, текст никуда не уходит. Инструмент не использует нейросети и внешние API.