ReText.AI опубликовала open-research: дообученная Gemma-2 с методом SimPO обходит ИИ-детекторы в 67% случаев на кулинарных текстах

Российская команда дообучила модель Gemma-2-9B-IT методом Simple Preference Optimization на датасете из 19 804 пар текстов, собранном из COLING-2025 и AINL-eval. В датасет вошли генерации восьми моделей разного масштаба — от 3 до 235 миллиардов параметров, включая Llama, Qwen, GigaChat и T-pro. Результат: медианная вероятность ИИ-авторства снизилась с 0.93 до 0.47.

Команда ReText.AI опубликовала детальное исследование эффективности своей модели «очеловечивания» ИИ-текста. В основе решения лежит дообучение модели Gemma-2-9B-IT (с использованием unsloth) методом SimPO (Simple Preference Optimization) — подходом, оптимизирующим качество генерации без необходимости вручную размечать предпочтения.

Как собирали данные

Исходные данные взяты из двух академических источников: датасет COLING-2025 (воркшоп по детекции машинного текста, сабтаск B), который включает русскоязычные и англоязычные тексты, а также AINL-eval с научными публикациями.

Для каждого исходного человеческого текста были сгенерированы «машинные» варианты с помощью восьми моделей разного масштаба. В их число вошли Llama-3.2 (3B параметров), Qwen3-8B (8B), GigaChat-2-Max, GLM-4.6, Llama-3.3-70B (70B), GPT-oss-120B (120B), Qwen3-235B-A22B (235B) и T-pro-it-1.0. Таким образом, датасет охватил модели от компактных до самых крупных открытых аналогов GPT.

Итоговый датасет составил 19 804 пары текстов, автоматически распределенных по 20 тематическим кластерам — от кулинарных рецептов до IT-разработки и правовых документов.

Как считали эффективность

Ключевая метрика — humanizer_score. Она рассчитывается как разница между вероятностью ИИ-авторства до обработки и после обработки, умноженная на коэффициент уверенности детектора. Проще говоря, метрика показывает, насколько сильно модель «очеловечивания» снижает подозрения детектора.

Что получилось

До обработки медианная вероятность того, что детектор сочтет текст ИИ-сгенерированным, составляла 0.93. После обработки этот показатель упал до 0.47. Лучший результат по средней дельте показали рецепты — прирост «очеловеченности» составил 0.518.

Еще один важный показатель — Hard Flip Rate, то есть доля текстов, которые после обработки детектор перестал считать ИИ-генерацией и «перевернул» свой вердикт. В категории рецептов этот показатель достиг 66.7%. Всего из 20 тематических категорий в 14 доля таких «перевернутых» решений превысила 50%.

Топ-5 категорий по Hard Flip Rate:

  • Рецепты и кулинария — 66.7%

  • Правовые системы — 64.2%

  • Бизнес и анализ рынка — 61.0%

  • Научные исследования — 60.8%

  • Управление персоналом — 59.9%

Где технология работает хуже

Наиболее сложными категориями оказались повседневные тексты (41.0%), многоязычные тексты (43.6%) и цифровые технологии (44.0%). Разработчики связывают это с тем, что обучающий датасет был преимущественно русско- и англоязычным, а также с высокой вариативностью стиля в этих доменах.

Общие выводы исследования

Для более чем 90% текстов «очеловечивание» снижает вероятность обнаружения ИИ. Метод SimPO показал высокую эффективность даже на компактной модели в 9 миллиардов параметров — для её запуска не требуется огромных вычислительных мощностей. Структурированные домены — право, бизнес, наука — обрабатываются лучше всего, тогда как основной вызов остается за многоязычными текстами.

Полные результаты исследования с графиками, методологией и примерами опубликованы в блоге ReText.AI.


О компании. ReText.AI — российский сервис для работы с текстом на основе искусственного интеллекта. Ключевые инструменты: перефразирование текста, проверка орфографии и пунктуации, ИИ-детектор (проверка текста на ИИ), очеловечивание и сокращение текста. Ежемесячно сервисом пользуются сотни тысяч человек.

Новости

Все

Кейс

Все

Пригласить СМИ на презентацию новой линейки продукции зарубежного бренда Roborock: «В Москве прошла масштабная презентация линейки новой техники Roborock 2025 года»

Пригласить СМИ на презентацию новой линейки продукции зарубежного бренда Roborock: «В Москве прошла масштабная презентация линейки новой техники Roborock»

В результате мероприятие посетили более 50 СМИ и вышло 106 публикаций, в том числе 16 проводок в ленте новостей Рамблер, 2 проводки в ленте новостей Google News и 1 проводка в ленте новостей Дзен, а также 4 поста в социальной сети Telegram, 4 поста в социальной сети ВКонтакте и 1 пост в социальной сети Одноклассники.

Новость опубликовали, в основном, издания следующих тематик:
• Технологические: 4PDA (охват 36.4M посетителей в месяц), Mobile Review (4.1M), iGuides (2.4M), iCHIP (2M), Robotobzor (172K), Gamers Life (57K), iXBT.pro;
• Федеральные и информационные СМИ: Рамблер (34.8M), Коммерсантъ (27.5M), CRE (61K), Smi24;
• Lifestyle: TheVoice (30M), Новый Очаг (4.6M), Tvigle (2.5M), Time Out (1.1M), NEW MAGAZINE (25K);
• И многие другие издания

Оцените преимущества Pronline прямо сейчас!

Если Вы журналист, редактор, представитель СМИ и хотите от нас получать новости и пресс-релизы на Вашу почту в первую очередь, то пожалуйста, введите свои контактные данные и выберите категории новостей, который вам интересны! Введите, пожалуйста, вашу почту, на нее будут приходить Вам новости как только они появятся в сервисе. Вы их будете получать первыми.

Смотрите также:

Пресс-релиз: Доля клиентов страхования жизни младше 35 лет за пять лет снизилась с 18% до 14%

Средний возраст новых клиентов, оформляющих программы страхования жизни, постепенно увеличивается. По данным «Эверия Лайф», средний возраст страхователя на момент заключения договора вырос с 45 лет в 2020 году до 46 лет в 2025 году. Медианный возраст увеличился с 44 до 46 лет.

Читайте также