Почему ИИ-нарезчики врут про реальных людей и книги — и как это исправлено
У больших языковых моделей есть неприятное свойство: если их попросить рассказать о чём-то, чего они не знают, они с большой вероятностью не скажут «не знаю» — они это придумают, уверенно и гладко. Для режима «Ролик по теме» это особенно опасная ловушка: тема часто называет что-то конкретное — книгу, человека, событие, — и если модель не знает этой конкретики, она может подменить незнание вымыслом, ни разу не намекнув на это в тоне.
Живой случай, который и стал поводом
Именно так произошло на теме «книга Мара и Морок»: модель не знала эту книгу, но вместо честного «не знаю» уверенно пересказала выдуманный сюжет — героев, завязку, развязку, — как будто это реальное содержание. Для зрителя, который эту книгу знает, это выглядело бы как явная ложь, преподнесённая с интонацией эксперта. И дело не в конкретной модели — так ведёт себя языковая генерация в принципе, если её не остановить архитектурно.
Сначала — классификация, потом — текст
Решение в Vertix — не просить модель «не выдумывай», это работает ненадёжно, — а не давать ей шанса выдумать в первую очередь. Перед тем как писать сценарий, отдельный дешёвый запрос классифицирует тему по типу: рассуждение о чём-то внешнем, внутреннее переживание, разбор конкретного произведения, рассказ о реальном человеке, о реальном событии, выдумка или инструкция. И отдельно — знает ли модель названную вещь вообще.
Тип темы не косметический ярлык — он подмешивается в промпт и включает разные правила достоверности. На произведении запрещено пересказывать сюжет по памяти. На выдумке, наоборот, ограничения на фантазию снимаются — там врать нечему, потому что там и так вымысел.
Что происходит, если модель не знает
Если тема — про конкретное произведение, человека или событие, а классификатор честно определяет, что модель эту вещь не знает, бот не пишет текст молча в надежде, что пронесёт. Вместо этого он прямо говорит об этом и даёт выбрать, что делать дальше:
- «Расскажу, о чём это» — коротко описываешь предмет сам, и это описание становится частью темы, по которой пишется сценарий
- «Свой текст целиком» — пишешь сценарий сам, без участия модели вообще
- «Всё равно напиши» — модель пишет, но с прямым запретом изображать осведомлённость: без выдуманного сюжета, героев и дат
- «Отмена»
Это применяется и при переписывании
Вердикт классификатора — знает модель вещь или нет — сохраняется и при повторной генерации. Если ты нажал «Сформулировать иначе», второй и третий вариант сценария пишутся с тем же типом темы и той же пометкой о незнании, а не как будто это уже что-то знакомое. Раньше это работало не так: второй вариант терял отметку и писался как рассуждение о знакомом предмете, без правил достоверности, ради которых всё это и заводилось. Теперь вердикт держится на всех попытках.
Почему это не «спрятать, что это ИИ»
Цель здесь не в том, чтобы скрыть, что ролик написан моделью, — это отдельная и, честно говоря, не особо интересная задача. Цель в том, чтобы то, что модель рассказывает, было правдой или честно помечено как незнание, а не выдумкой с интонацией факта. Разница простая: зритель, который разбирается в теме лучше бота, не должен наткнуться на уверенно поданную ложь.