LLMs respond differently to harmful prompts when AI watermarking is used

SynthID может заставить модели выполнять вредные инструкции, которые они в противном случае откажутся выполнять.
Читать полный текст в источникеarstechnica.com — arstechnica.com
Материал собран автоматически из открытых RSS-источников. Пересказ приведён в информационных целях в соответствии со ст. 1274 ГК РФ с указанием первоисточника; полное воспроизведение не осуществляется. Мнения авторов оригинала не обязательно отражают позицию ООО «АЛТЕЯ». Все источники проверены по реестру СМИ-иноагентов Минюста РФ (255-ФЗ).