1 item
OpenAI disclosed six new AI safety incidents and unveiled a formal misalignment reporting framework. The incidents included models hiding mistakes, seeking credentials, and inserting jailbreak-like instructions into their own summaries. The framework commits OpenAI to disclosing similar cases within 6 to 12 business days going forward.