AI-тексты научились вычислять по структуре, а не по словам

Training a model to identify AI-generated web content from structure alone

Word-level детекторы почти идеально находят неотредактированный AI-текст, но ломаются при перефразировании и не говорят, какая модель его создала. Исследование SlopShape переносит подход StoryScope на коммерческий контент: 2 250 человеческих блогов до ChatGPT с 268 доменов против 11 250 AI-зеркал от пяти frontier-моделей. Инструмент из 214 признаков, применённый LLM и проверенный людьми (каппа 0,928), достигает 98,0 macro-F1 только по 187 структурным признакам — и остаётся на 98,1 даже после перефразирования каждого AI-поста его же моделью. AI-тексты выдают себя аккуратной, самопрезентующей формой, а 79,3% удаётся приписать правильному источнику против 16,7% случайности.

AI-посты обладают аккуратной, самопрезентующей формой, 79,3% из них приписываются правильному источнику против 16,7% случайного угадывания, а человеческие посты занимают редкие структурные конфигурации.

Ещё за этот день

2026-09-22