Детектор ИИ-текста онлайн: burstiness, маркеры и метрики локально

Вставьте текст на русском или английском — получите вероятность 0–100%, таблицу метрик с комментариями и подсветку фраз-маркеров. Считается локально по статистике текста; это эвристика с погрешностью, а не приговор.

работает в браузере · данные никуда не отправляются

эвристика · результат — не доказательство

Как пользоваться

  1. Вставьте текст от 150 слов — короче статистика не набирается, и инструмент честно скажет, что оценивать нечего.
  2. Оценка появится сама: процент в моно, шкала и вердикт «скорее человек / неясно / признаки ИИ».
  3. Ниже — таблица метрик: значение, норма для живого текста и комментарий, в какую сторону метрика тянет.
  4. В блоке текста подсвечены найденные фразы-маркеры («важно отметить», «в современном мире», «delve», «tapestry»); их полезно вычистить, даже если текст ваш.

Как работает детектор

Полноценные детекторы вроде GPTZero считают perplexity — насколько текст предсказуем для языковой модели. В браузере без модели это невозможно, поэтому инструмент опирается на статистические признаки, которые коррелируют с машинным текстом. Главный — burstiness: коэффициент вариации длины предложений. Люди пишут неровно: короткая фраза, потом длинная на три строки; модели выдают предложения близкой длины. Дальше — разнообразие словаря (TTR и MATTR по окнам в 50 слов), энтропия слов и биграмм, доля пассивных конструкций, однородность абзацев по длине, частота эм-тире и конструкций «— это», «правило трёх» (перечисления ровно из трёх элементов), отсутствие первого лица и «человеческого мусора» — скобок, эмодзи, многоточий, сленга, опечаток-двойных пробелов.

Отдельный слой — словарь фраз-маркеров, характерных для ChatGPT и его родственников: по-русски «в современном мире», «важно отметить», «играет ключевую роль», «представляет собой», «является неотъемлемой частью», «давайте разберёмся», «в заключение»; по-английски «delve», «tapestry», «testament to», «it's important to note», «in today's fast-paced world», «not only … but also», «leverage», «seamless», «robust». Каждая метрика сдвигает итог на несколько пунктов от нейтральных 50%.

Почему детекторы ошибаются

  • Формальный человеческий текст (юридический, научный, пресс-релиз) выглядит «машинно»: ровные предложения, пассив, никакого первого лица. Ложные срабатывания на нём — норма для любого детектора, включая коммерческие.
  • Отредактированный ИИ-текст с вычищенными маркерами и переставленными предложениями проходит как человеческий. Метрики ловят ленивую генерацию, а не старательную.
  • Переводы и тексты не-носителей часто «ровнее» и беднее словарём — детектор тянет их к ИИ.
  • Короткие тексты дают шум: на 100 словах коэффициент вариации ничего не значит, поэтому ниже 150 слов оценка не выдаётся.

Зачем это арбитражнику

Модерация Facebook, Google Ads и Яндекс Дзена, редакции площадок для гостевых постов и биржи контента всё чаще прогоняют тексты через детекторы. Прокладки, прелендинги и SEO-статьи, написанные нейросетью «как есть», получают отказ или пессимизацию как шаблонные. Инструмент показывает, какие именно признаки выдают генерацию: где выровнять ритм предложений, какие обороты вычистить, где добавить конкретики и первого лица. Это дешевле, чем узнать о проблеме после отклонения кампании.

Частые вопросы

Насколько точен детектор ИИ-текста?

Это эвристика: на очевидных случаях (сырой ChatGPT против живого поста) она работает уверенно, на формальных человеческих текстах и отредактированной генерации ошибается. Результат — повод присмотреться, а не доказательство. Ни один детектор, включая платные, не даёт юридически значимого ответа.

Что такое burstiness и perplexity?

Perplexity — мера предсказуемости текста для языковой модели: у ИИ-текста она ниже. Burstiness — неравномерность: разброс длины предложений и слов. Люди пишут «рывками», модели — ровно. Здесь считается burstiness и статистические заменители perplexity: энтропия слов и биграмм, разнообразие словаря.

Почему нужен текст от 150 слов?

Коэффициенты вариации и энтропия на коротком тексте — шум: три предложения могут быть ровными случайно. От 150 слов статистика становится осмысленной, от 300 — устойчивой.

Работает ли детектор с английским текстом?

Да, язык определяется автоматически. Для английского применяются свой список маркеров («delve», «tapestry», «testament to», «in conclusion»), своя эвристика пассива (be + причастие) и свой список первого лица и сленга.

Отправляется ли текст на сервер?

Нет. Все метрики считаются JavaScript-кодом в браузере, текст никуда не уходит. Инструмент не использует нейросети и внешние API.

свежие базы — в канале Подписаться на канал