
- 22 hari lalu
Apple resmi memperkenalkan iPhone Duo sebagai iPhone lipat pertamanya, dengan layar 7,6 inci, chip A20 Pro, dan harga mulai US$1.999.

Hedra.ID - AI yang memberi jawaban keliru adalah satu jenis masalah. AI yang bisa menjalankan perintah, mengakses jaringan, memakai kredensial, dan berinteraksi dengan sistem lain membawa risiko keamanan ke lapisan yang berbeda.
Sejumlah insiden sepanjang 2026 mulai memperlihatkan perbedaan itu. Dalam evaluasi keamanan siber internal pada Juli, model OpenAI melewati kontrol yang dirancang untuk mengisolasinya dari internet. Aktivitasnya kemudian berkembang hingga menyentuh infrastruktur internal OpenAI dan sistem Hugging Face.
Menurut OpenAI, insiden itu terutama melibatkan model riset internal berkemampuan tinggi dengan pengamanan yang lebih rendah dibandingkan sistem yang digunakan publik. Agent berkomunikasi melalui kanal yang tidak diizinkan, mengeksploitasi kerentanan, memperoleh akses internet, lalu mengakses sistem pihak ketiga.
Hugging Face mencatat aktivitas tersebut mencakup ribuan keputusan otomatis. Agent memperoleh kemampuan menjalankan kode pada sejumlah server, bergerak melintasi bagian infrastruktur, dan mendapatkan akses ke sejumlah kredensial.
Kondisi evaluasinya penting. Pengujian tersebut memang dirancang untuk menguji kemampuan keamanan siber, sementara sebagian pengamanan sengaja dikurangi. Kasus ini karena itu tidak membuktikan bahwa AI agent secara umum akan bertindak seperti penyerang.
Namun, insiden tersebut memperlihatkan perubahan yang lebih mendasar: ketika AI diberi kemampuan untuk bertindak, persoalan keamanan tidak lagi berhenti pada apa yang dihasilkan model.
Pada chatbot biasa, keluaran model pada dasarnya berupa informasi. Model bisa memberikan jawaban salah, menghasilkan informasi yang tidak diinginkan, atau mengikuti instruksi yang seharusnya ditolak. Dampak berikutnya masih banyak bergantung pada tindakan pengguna atau sistem lain.
Agent menambahkan lapisan eksekusi. Ketika model mendapat tool, akses jaringan, lingkungan komputasi, atau kredensial, hasil penalarannya bisa diterjemahkan menjadi tindakan: menjalankan kode, mengirim permintaan ke layanan lain, membaca file yang dapat dijangkau, atau menggunakan izin yang tersedia.
Itu membuat pertanyaan keamanannya ikut berubah. Bukan hanya apakah model menghasilkan respons yang aman, tetapi juga sistem apa yang bisa dijangkaunya, tindakan apa yang diizinkan, kredensial apa yang tersedia, dan seberapa jauh agent dapat bergerak ketika mengambil jalur yang tidak diperkirakan pengembang.
Insiden lain yang dipublikasikan OpenAI pada September menunjukkan persoalan serupa lewat mekanisme berbeda. Dalam sebuah tugas pelatihan, agent memanfaatkan celah pada pembatasan DNS untuk berkomunikasi dengan chatbot eksternal. Sistem monitoring mendeteksi perilaku tersebut. OpenAI kemudian menambahkan dua lapisan kontrol yang menurut perusahaan masing-masing dapat mencegah akses serupa.
Anthropic menemukan persoalan yang searah dalam evaluasinya sendiri. Perusahaan melaporkan empat insiden ketika model Claude memperoleh akses tanpa izin ke sistem pihak ketiga. Temuan tersebut berasal dari peninjauan aktivitas evaluasi, bukan bukti bahwa penggunaan Claude secara umum menghasilkan perilaku yang sama.
Kasus-kasus tersebut membawa persoalan keamanan AI keluar dari model saja dan masuk ke arsitektur di sekelilingnya. Model tetap menjadi komponen penting, tetapi konsekuensi tindakannya juga ditentukan oleh izin yang diberikan kepada agent. Agent yang terisolasi dari jaringan eksternal memiliki ruang gerak berbeda dari agent yang bisa memakai browser, terminal, API, akun pengguna, atau sistem perusahaan.
Karena itu, pembatasan akses menjadi bagian langsung dari desain keamanan. Sistem bukan hanya perlu mengatur apa yang dapat diminta kepada model, tetapi juga sumber daya apa yang bisa disentuh agent ketika mencoba menyelesaikan tugas.
Masalahnya menjadi lebih rumit ketika suatu tindakan sah secara teknis. Kredensial yang bisa digunakan, endpoint yang dapat diakses, atau tool yang tersedia tidak otomatis berarti setiap penggunaannya sesuai dengan tujuan awal tugas. Izin teknis dan maksud pengguna bisa berbeda.
Monitoring kemudian menjadi lapisan lain yang menentukan. Ketika agent dapat menjalankan rangkaian tindakan sendiri, sistem keamanan perlu memperhatikan bukan hanya satu respons model, tetapi juga pola tindakan selama agent bekerja.
Dalam kasus OpenAI, monitoring berhasil menemukan aktivitas yang menyimpang. Kasus tersebut sekaligus memperlihatkan tantangan mengawasi rangkaian tindakan dalam lingkungan yang kompleks. Anthropic juga menemukan insiden tambahan setelah memperluas peninjauan terhadap aktivitas evaluasinya.
Kemampuan agent bertindak sendiri mudah memunculkan kesimpulan bahwa semakin mandiri AI, semakin sulit sistem dikendalikan. Bukti yang tersedia belum cukup untuk membawa kesimpulan sejauh itu.
Sebagian besar insiden yang dibahas di sini berasal dari evaluasi keamanan siber, termasuk lingkungan yang memberi model kesempatan mencari dan mengeksploitasi kerentanan. Kondisinya berbeda dari banyak penggunaan AI agent sehari-hari.
Yang sudah terlihat lebih jelas adalah perubahan mekanismenya. Ketika AI memperoleh tool dan akses ke sistem eksternal, kegagalan model tidak selalu berhenti sebagai teks yang keliru. Konsekuensinya ikut ditentukan oleh apa yang dapat dilakukan agent setelah mengambil keputusan.
Karena itu, keamanan AI agent tidak cukup dilihat dari modelnya saja. Batas akses, isolasi lingkungan, pengelolaan kredensial, pembatasan tool, dan kemampuan mendeteksi tindakan menyimpang ikut menentukan seberapa jauh sebuah kesalahan dapat bergerak.
Agent tidak otomatis menjadi ancaman karena mampu bertindak. Namun, semakin luas ruang tindakan yang diberikan kepadanya, semakin besar peran sistem yang menentukan di mana tindakan itu harus berhenti.