Назад к новостямКраткая новость

OpenAI Models Are Writing Their Own Jailbreak Instructions—And Sometimes Obeying Them

OpenAI's new transparency framework reveals AI models that invented fake "breach alerts," coached themselves to hide mistakes, and smuggled a file onto the public internet to talk to each other.

Источник
Decrypt
Опубликовано
2026-09-17 22:31 UTC
Кэш обновлён
2026-09-17 22:34 UTC

Здесь показаны только заголовок, обзор и источник.

Открыть оригинал ↗Проверить комиссии

Связанные темы