Отчёт о привычках письма
Вставьте черновик и увидите измеримые привычки, из-за которых текст читается как сгенерированный: одинаковая длина предложений, слова-приметы, дежурные связки, плотность длинных тире, нехватка конкретики. Дальше вы их выправите.
Это не детектор
Здесь не выводится вероятность того, что текст сгенерирован, потому что честное детерминированное измерение её дать не может. Детекторы вроде GPTZero оценивают, насколько предсказуемо каждое слово и насколько сильно это колеблется, и ставят сверху обученный классификатор; ничто здесь ничего подобного не делает. Вы получаете список привычек и то, что с каждой из них сделать.
Несколько сотен слов дают самый полезный отчёт. Ничего никуда не отправляется.
Пока нечего измерять
Вставьте черновик выше. Всё считается в этой вкладке; текст не покидает браузер.
Что измеряется и зачем каждое измерение
Разброс длин предложений
Самый сильный одиночный признак. Сгенерированные черновики держатся одной длины, а человеческое письмо так не делает. В отчёте есть среднее, стандартное отклонение, коэффициент вариации и гистограмма из пяти корзин.
Форма абзацев
Одинаковая длина абзацев повторяет ту же привычку уровнем выше. Черновик, где в каждом абзаце ровно три предложения, читается как метроном.
Слова и обороты-приметы
Шестьдесят четыре слова и сорок пять оборотов, чрезмерно представленных в прозе после 2023 года, подсчитанных и приведённых к тысяче слов. Одно «delve» не значит ничего; двенадцать примет на тысячу слов складываются в привычку.
Ритм и подача
Дежурные связки в начале предложений, плотность длинных тире, противопоставление «это не X, это Y» и перечисления из трёх. У каждого есть порог, ниже которого не говорится ничего.
Отсутствие конкретики
Числа, имена собственные, стяжённые формы и первое лицо. Сгенерированный текст обобщён по своему устройству, поэтому их отсутствие поддаётся измерению там, где присутствие не поддавалось бы.
Посмотрите отчёт о привычках письма
Черновик измеряется: слова, предложения, средняя длина предложения, стандартное отклонение, разброс, дежурные связки, смягчители и плотность тире, и рядом с каждым стоит число. Числа вместо оценки, никакой вероятности и никакого вывода о том, кто написал текст.
Смотреть
Чтение отчёта о привычках письма
30 секунд · Субтитры включены
Чего это вам не скажет
- Сгенерирован ли текст. Числа, которое отвечало бы на этот вопрос, здесь нет, и это намеренно.
- Есть ли статистический водяной знак. SynthID-Text и подобные схемы зашиты в выбор слов и без ключа не обнаруживаются.
- Правил ли человек сгенерированный черновик или сгенерировал план и написал текст сам. И то и другое встречается часто, и здесь не видно ни того, ни другого.
- Хорошо ли написано. Бывает отличная проза с ровным ритмом, бывает никуда не годная с рваным.
Вопросы об отчёте о стиле
Почему нет процентов или балла?
Потому что это было бы нечестно. Проценты подразумевают откалиброванную вероятность, а ничто из измеренного здесь её не даёт: каждая привычка из отчёта встречается и в человеческом письме. Отчёт выдаёт измерения и оставляет суждение там, где ему место.
Чем это отличается от ИИ-детектора?
Детектор оценивает, насколько предсказуемо каждое слово для языковой модели и насколько сильно эта предсказуемость колеблется, а затем прогоняет сверху классификатор. Здесь подсчитываются привычки в том тексте, что перед вами, детерминированно, с одинаковым результатом каждый раз. Модели нет, и о происхождении текста ничего не утверждается.
Мой черновик куда-нибудь отправляется?
Нет. Разбор идёт во вкладке вашего браузера. Сайт собран статически, без бэкенда; отправлять некуда. Аналитика, если вы на неё согласились, записывает количество слов и никогда сам текст.
Сколько текста ему нужно?
Некоторым измерениям нужен минимум, прежде чем они что-то скажут: наблюдениям о длине предложений нужно пять предложений, плотности словаря восемьдесят слов, проверкам на конкретику сто пятьдесят. Ниже этих порогов числа всё равно показываются, а наблюдений просто нет.
Если я уберу всё, что он отметил, детектор пропустит мой текст?
Почти наверняка нет, и цель не в этом. Детекторы оценивают предсказуемость слов, а её эти правки почти не меняют. Убрав такие привычки, вы сделаете текст лучше и больше похожим на свой; классификатор это не обманет.
Ответ совпадает с инструментом командной строки?
Да, до цифры. Эта страница переносит style_report.py на веб, и оба проверяются на одних и тех же фикстурах в непрерывной интеграции: те же измерения, те же пороги, те же формулировки в каждом наблюдении.