OpenAI навчає ChatGPT зізнаватися в обмані й порушенні інструкцій
За даними OpenAI, Confessions — це другий вихід моделі, який оцінюють лише за чесністю, а не за корисністю чи стилем. Якщо система прямо визнає, що обійшла інструкцію або видала здогад…