OpenAI начнет помечать тексты ChatGPT невидимым водяным знаком: ИИ можно будет распознать
OpenAI начнет помечать тексты ChatGPT невидимым водяным знаком
Компания OpenAI объявила о внедрении невидимой маркировки для текстов, которые генерируют ChatGPT и Codex. На первом этапе технология будет распространяться среди пользователей в Европейском союзе.
Новая система получила название textGrain. Она формирует в тексте незаметный для человека статистический сигнал, связанный с выбором слов моделью. Специальный детектор сможет анализировать этот сигнал и определять, присутствует ли в тексте водяной знак OpenAI.
Компания объясняет решение требованиями европейского законодательства. Согласно правилам ЕС в сфере искусственного интеллекта, создатели генеративных систем должны сделать контент, созданный ИИ, распознаваемым для машин.
OpenAI планирует начать поэтапное внедрение textGrain в ChatGPT и Codex в ближайшие недели. На старте маркировка будет распространяться на пользователей в ЕС, причем речь идет об имеющих право на использование функции клиентах всех тарифных планов. Глобальным стандартом для ChatGPT технология пока не станет.
Одновременно OpenAI открывает возможность подключения маркировки для клиентов API по всему миру. Однако там функция останется отключенной по умолчанию и будет доступна для отдельных моделей в режиме opt-in.
Перефразирование может ослабить отметку
В OpenAI подчеркивают, что textGrain не делает текст визуально отличимым от обычного ответа чат-бота. Читатель не увидит никаких специальных символов или пометок.
При этом компания признает, что технология пока имеет ограничения. Надежность распознавания зависит в том числе от объема текста и его содержания. Чем короче фрагмент, тем сложнее обнаружить заложенный в него сигнал.
Еще один важный фактор — редактирование. В проведенном OpenAI тесте при замене 10% слов синонимами доля правильно обнаруженных водяных знаков снизилась примерно с 92% до 66%. Если изменить 25% слов, показатель упал до 17%.
Таким образом, простое копирование текста не обязательно будет единственным сценарием, при котором отметка сохранится: существенное редактирование способно значительно ослабить сигнал.
OpenAI также отмечает, что система может ошибаться. Детектор способен выдать ложноположительный результат, когда водяного знака на самом деле нет, либо не обнаружить существующую маркировку.
Водяной знак не доказывает авторство ИИ
Компания отдельно оговаривает, что обнаружение textGrain не означает автоматического доказательства того, что весь текст был написан искусственным интеллектом.
Маркировка показывает лишь наличие сигнала, связанного с использованием системы OpenAI. Она не позволяет определить, сколько работы в материал внес человек, кто именно пользовался ChatGPT, из какой учетной записи был получен текст или какой был использован запрос.
Кроме того, отсутствие водяного знака не будет означать, что текст обязательно написал человек. Отметка может не определиться из-за слишком короткого или отредактированного материала, перевода, использования другой модели либо потому, что текст был создан до появления системы маркировки.
OpenAI пока не собирается делать детектор общедоступным. Получить доступ к нему смогут одобренные исследователи и специализированные организации, которые будут участвовать в проверке и совершенствовании технологии.
Компания также заявляет, что textGrain не должен заметно ухудшать качество работы моделей. В проведенных OpenAI тестах показатели моделей с маркировкой и без нее существенно не различались.
Новая система станет частью более широкой программы OpenAI по определению происхождения цифрового контента. Для изображений компания уже использует другие технологии маркировки и метаданные, а теперь аналогичный подход распространяется и на текст.
OpenAI намерена продолжить тестирование textGrain и впоследствии сделать технологию открытой, чтобы другие разработчики могли использовать ее для создания собственных инструментов проверки.
Как ранее писал Topnews, ChatGPT начали блокировать в России: соединение обрывается до серверов OpenAI.

