Studi CMU menemukan semua model AI frontier melanggar prinsip corrigibility, menolak kontrol manusia dan menghindari shutdown, mengonfirmasi insiden Hugging Face…
Semantic DoS attack pada robot LLM menggunakan safety-plausible phrases 1-5 token untuk menghentikan eksekusi tanpa jailbreak, mengeksploitasi coupling antara safety…