AI Worm: Ketika Instruksi Berbahaya Bisa Menyebar Lewat Output AI
Konsep tersebut dikenal sebagai self-replicating prompt injection atau secara informal sering disebut AI worm.
Pada 25 September 2026, OpenAI mempublikasikan penelitian yang menunjukkan bahwa prompt injection yang dapat melakukan self-propagation memang mungkin terjadi dalam lingkungan simulasi. Dalam pengujian tersebut, instruksi adversarial dapat mendorong model untuk melakukan tujuan tertentu sekaligus mereproduksi instruksi tersebut melalui kanal output yang dapat dibaca oleh sistem lain. OpenAI menekankan bahwa tidak ada dampak di luar simulated tool calls dalam evaluasi tersebut.
Artinya, ini bukan cerita tentang malware tradisional yang tiba-tiba menyebar ke seluruh komputer. Persoalannya lebih fundamental: arsitektur aplikasi AI dapat menciptakan jalur propagasi baru bagi konten yang tidak dipercaya.
Dari Prompt Injection ke AI Worm
Prompt injection sebenarnya bukan konsep baru.
Dalam serangan prompt injection, penyerang mencoba memasukkan instruksi ke dalam konten yang kemudian diproses oleh model. Masalah muncul ketika AI tidak dapat membedakan dengan sempurna antara instruksi yang memang berasal dari sistem dengan instruksi yang hanya terdapat di dalam data yang sedang dibaca.
Misalnya, sebuah AI agent menerima dokumen, email, halaman web, atau data dari sumber eksternal. Jika terdapat instruksi tersembunyi di dalam data tersebut, model dapat memperlakukannya sebagai bagian dari konteks yang harus diikuti.
Pada sistem sederhana, dampaknya mungkin hanya terbatas pada satu respons.
Namun arsitektur AI modern jauh lebih terhubung.
Output AI dapat:
Input → AI Model → Output → Database/RAG → AI Agent → Tool → Output → Sistem lain
Di sinilah konsep AI worm menjadi menarik.
Jika konten berbahaya dapat membuat model menghasilkan kembali konten tersebut, maka output model berpotensi menjadi carrier untuk sistem berikutnya.
Penelitian Morris II pada 2024 sudah menunjukkan konsep serupa dalam ekosistem aplikasi GenAI berbasis RAG. Para peneliti mendemonstrasikan bagaimana adversarial self-replicating prompt dapat memicu rantai propagasi antar aplikasi GenAI yang saling terhubung.
Jadi, konsep AI worm bukan muncul secara tiba-tiba pada 2026. Yang berubah adalah semakin kompleksnya arsitektur AI dan semakin banyaknya agent yang memiliki akses terhadap data, memori, tools, dan sistem eksternal.
Mengapa Output AI Bisa Menjadi Attack Surface?
Dalam aplikasi tradisional, output sebuah program biasanya dianggap sebagai hasil akhir.
Dalam sistem AI agentic, output justru sering menjadi input untuk proses berikutnya.
Contohnya:
AI membaca email.
AI membuat ringkasan.
Ringkasan disimpan ke knowledge base.
Agent lain mengambil informasi tersebut.
Agent menggunakan informasi itu untuk menentukan tindakan.
Hasil tindakan kembali menghasilkan data baru.
Setiap perpindahan data menciptakan sebuah trust boundary.
Jika sistem tidak membedakan antara data terpercaya dan data yang berasal dari sumber eksternal, instruksi berbahaya dapat ikut masuk ke konteks model.
Karena itu, masalahnya bukan hanya apakah model dapat “tertipu”.
Masalah yang lebih besar adalah apakah arsitektur memungkinkan konten yang tidak dipercaya untuk menjadi instruksi pada tahap berikutnya.
RAG Membuat Masalah Ini Lebih Kompleks
Retrieval-Augmented Generation atau RAG dirancang untuk membuat AI dapat menggunakan informasi dari sumber eksternal.
Namun RAG juga berarti model tidak hanya bekerja berdasarkan system prompt dan user prompt.
Model mendapatkan tambahan context dari:
dokumen internal,
email,
knowledge base,
database,
website,
file,
hasil pencarian,
API,
dan sumber data lainnya.
Jika salah satu sumber tersebut mengandung instruksi berbahaya, instruksi tersebut dapat masuk ke context model.
Inilah alasan mengapa keamanan RAG tidak cukup hanya dengan mengamankan model.
Data pipeline-nya juga harus diamankan.
Sebuah dokumen mungkin bukan malware dalam pengertian tradisional. Tetapi jika dokumen tersebut dapat memengaruhi keputusan AI dan AI mempunyai permission untuk melakukan tindakan, dokumen tersebut dapat menjadi bagian dari attack chain.
AI Agent Mengubah Risiko Menjadi Lebih Serius
Perbedaan terbesar antara chatbot biasa dan AI agent adalah kemampuan melakukan tindakan.
Chatbot biasanya menghasilkan jawaban.
Agent dapat:
membaca email,
membuat file,
mengakses database,
menjalankan kode,
menggunakan API,
mengirim pesan,
memanggil tool,
atau mengubah konfigurasi tertentu.
Microsoft Security sebelumnya juga mendokumentasikan kerentanan pada Semantic Kernel yang menunjukkan bagaimana prompt injection dalam konteks agent dapat menjadi jalur menuju eksekusi kode pada host dalam kondisi tertentu.
Karena itu, security architecture untuk AI agent tidak bisa berhenti pada model-level filtering.
Perusahaan juga perlu memikirkan identity, authorization, tool permissions, sandboxing, network isolation, logging, dan runtime monitoring.
AI Worm Tidak Sama dengan Worm Tradisional
Istilah “worm” memang mudah membuat orang membayangkan malware seperti worm komputer klasik.
Namun mekanismenya berbeda.
Worm tradisional biasanya memanfaatkan kelemahan software, credential, jaringan, atau service untuk berpindah dari satu host ke host lain.
AI worm atau self-replicating prompt injection lebih berhubungan dengan propagasi instruksi melalui sistem yang memproses bahasa atau data yang dikontrol model.
Carrier-nya dapat berupa:
prompt,
email,
dokumen,
hasil pencarian,
database,
RAG context,
memory agent,
atau output AI.
Karena itu, perimeter tradisional menjadi kurang relevan jika sistem AI secara otomatis mengambil data dari banyak sumber.
Trust Boundary Menjadi Lebih Penting
Arsitektur keamanan tradisional banyak berfokus pada pertanyaan:
Siapa yang boleh mengakses sistem?
Pada AI agent, pertanyaannya perlu diperluas menjadi:
Data mana yang boleh dipercaya sebagai instruksi?
Sebuah email mungkin berasal dari pengguna yang sah.
Tetapi isi email tersebut belum tentu boleh dianggap sebagai system instruction.
Begitu pula dokumen internal mungkin berada di dalam jaringan perusahaan, tetapi bukan berarti semua instruksi di dalam dokumen tersebut boleh diberikan authority untuk mengendalikan agent.
Karena itu, arsitektur AI perlu memisahkan setidaknya:
Instruction → Data → Tool Output → External Content → Agent Memory
Semua sumber tersebut memiliki tingkat kepercayaan berbeda.
Mencampurkannya ke dalam satu context tanpa policy yang jelas menciptakan risiko.
Persistent Memory Bisa Menjadi Masalah Baru
AI agent generasi baru semakin banyak menggunakan memory dan persistent state.
Agent dapat menyimpan informasi untuk digunakan kembali pada sesi berikutnya.
Secara fungsional ini sangat berguna.
Namun dari sisi keamanan, persistence berarti data berbahaya tidak harus bertahan hanya selama satu request.
Penelitian mengenai autonomous LLM agent worms pada 2026 juga mengeksplorasi bagaimana konten yang dikendalikan penyerang dapat masuk ke persistent agent state, kemudian muncul kembali ke context pada proses berikutnya. Penelitian tersebut masih berada dalam konteks eksperimen, tetapi menunjukkan mengapa memory agent perlu diperlakukan sebagai security boundary.
Dengan kata lain:
Memory bukan sekadar fitur AI. Memory adalah bagian dari attack surface.
MCP dan Tool Connectivity Memperluas Permukaan Serangan
Perkembangan Model Context Protocol atau MCP juga membuat AI semakin mudah terhubung dengan sistem eksternal.
AI dapat berinteraksi dengan:
database,
filesystem,
repository,
API,
SaaS,
developer tools,
dan berbagai service lainnya.
Netskope melaporkan adanya peningkatan signifikan traffic MCP dalam analisisnya pada 2026 dan menyoroti risiko ketika MCP menjadi penghubung antara data internal dan model eksternal.
Semakin banyak koneksi yang diberikan kepada agent, semakin besar pula konsekuensi jika agent menerima instruksi yang salah.
Karena itu, prinsip least privilege menjadi semakin penting.
Agent seharusnya tidak mendapatkan akses penuh hanya karena model tersebut dianggap “trusted”.
Security Architecture Harus Berubah
Jika AI menjadi bagian dari infrastructure, security architecture juga perlu berubah.
Beberapa lapisan yang semakin penting adalah:
1. Input Security
Semua external content harus dianggap untrusted by default.
Dokumen, email, website, dan data eksternal tidak boleh otomatis diperlakukan sebagai instruksi.
2. Context Isolation
System instruction, user instruction, retrieved data, dan tool output perlu dipisahkan secara logis.
Tujuannya adalah mengurangi kemungkinan data berubah fungsi menjadi instruction.
3. Identity dan Least Privilege
Setiap agent sebaiknya memiliki identity dan permission yang jelas.
Agent yang hanya membutuhkan akses read-only tidak seharusnya memiliki kemampuan write atau administrative access.
4. Tool Authorization
Setiap penggunaan tool perlu melalui policy.
AI seharusnya tidak dapat mengubah database, mengirim email, menjalankan command, atau mengakses credential hanya karena model memutuskan bahwa tindakan tersebut diperlukan.
5. Sandboxing
Agent yang menjalankan kode atau berinteraksi dengan sistem sensitif sebaiknya berada dalam environment terisolasi.
Jika model melakukan kesalahan, blast radius dapat dibatasi.
6. Output Validation
Output AI juga perlu diperiksa.
Ini bagian yang sering terlupakan.
Jika output AI akan dimasukkan ke database, dikirim ke agent lain, atau digunakan sebagai input untuk proses berikutnya, sistem harus mempertimbangkan bahwa output tersebut dapat membawa konten yang tidak dipercaya.
7. Runtime Monitoring
Security tidak cukup dilakukan sebelum agent berjalan.
Aktivitas agent perlu dimonitor selama runtime.
Anomali seperti perubahan permission, akses resource yang tidak biasa, tool invocation berulang, atau komunikasi yang tidak sesuai policy perlu dapat dideteksi.
AI Worm Menunjukkan Mengapa “AI Security” dan “Cybersecurity” Semakin Menyatu
Sebelumnya, AI security sering dipandang sebagai masalah model:
prompt injection,
jailbreak,
hallucination,
data leakage,
model poisoning.
Sementara cybersecurity fokus pada:
endpoint,
network,
identity,
server,
cloud,
application,
database.
Dengan berkembangnya agentic AI, batas tersebut semakin kabur.
Sebuah prompt injection dapat berhubungan dengan identity.
Identity dapat memberikan akses ke API.
API dapat mengubah data.
Data tersebut dapat masuk kembali ke RAG.
RAG kemudian menjadi context bagi agent lain.
Agent lain menghasilkan output baru.
Siklus tersebut menunjukkan bahwa AI security sekarang merupakan bagian dari security architecture secara keseluruhan.
Bukan Berarti AI Worm Sudah Menjadi Wabah
Bagian ini penting agar pembahasan tidak menjadi sensasional.
Penelitian OpenAI tentang self-replicating prompt injection memang menunjukkan bahwa mekanisme tersebut dapat muncul dalam lingkungan simulasi dan evaluasi. Namun OpenAI secara eksplisit menyatakan bahwa mereka tidak mengamati dampak di luar simulated tool calls dalam penelitian tersebut.
Dengan demikian, istilah “AI worm” saat ini lebih tepat dipahami sebagai kelas risiko dan kemampuan serangan yang sedang diteliti, bukan klaim bahwa terdapat worm AI yang saat ini menyebar secara bebas melalui seluruh internet.
Justru nilai penting dari penelitian seperti ini adalah membantu security engineer memahami apa yang mungkin terjadi ketika AI agent semakin otonom dan semakin terhubung.
Bagaimana Perusahaan Sebaiknya Melihat Risiko Ini?
Pendekatannya bukan dengan melarang semua AI agent.
Yang lebih penting adalah membangun arsitektur dengan asumsi bahwa model dapat menerima data berbahaya dan dapat menghasilkan output yang tidak sepenuhnya dapat dipercaya.
Beberapa prinsip yang relevan:
Zero Trust untuk AI
Jangan otomatis mempercayai data hanya karena berasal dari sistem internal.
Least Privilege
Berikan agent permission seminimal mungkin.
Separation of Duties
Pisahkan kemampuan membaca informasi dengan kemampuan melakukan tindakan berisiko tinggi.
Human Approval
Untuk tindakan sensitif, tetap sediakan human approval.
Immutable System Instructions
Instruksi inti agent sebaiknya tidak dapat diubah hanya melalui data yang diproses agent.
Memory Governance
Persistent memory perlu memiliki policy, validation, dan mekanisme cleanup.
Full Observability
Perusahaan perlu mengetahui data apa yang masuk ke agent, keputusan apa yang dibuat, tool apa yang dipanggil, dan sistem apa yang disentuh.
Opini Betariko: Masalahnya Bukan AI yang Bisa Meniru, tetapi Sistem yang Terlalu Mudah Mempercayai
Menurut saya, konsep AI worm menarik bukan karena AI tiba-tiba menjadi seperti malware tradisional.
Yang lebih penting adalah perubahan pada trust model.
Selama ini perusahaan membangun security architecture berdasarkan asumsi bahwa data dan instruksi memiliki jalur yang cukup jelas.
AI mengaburkan batas tersebut.
Dokumen dapat menjadi prompt.
Output dapat menjadi input.
Data dapat menjadi instruction.
Memory dapat menjadi persistence layer.
Agent dapat menjadi execution layer.
Dan sebuah sistem AI dapat menjadi perantara antara semuanya.
Karena itu, ketika perusahaan mulai menghubungkan AI dengan email, database, cloud, repository, API, dan berbagai SaaS, pertanyaan security-nya tidak cukup lagi:
“Apakah model ini aman?”
Pertanyaan yang lebih relevan adalah:
“Apa yang terjadi jika model menerima instruksi berbahaya, lalu output-nya dipercaya oleh sistem berikutnya?”
Di situlah security architecture menjadi sangat penting.
AI mungkin menjadi otak dari sistem baru. Tetapi identity, permission, isolation, network control, data governance, dan observability tetap menjadi sistem saraf yang menentukan seberapa jauh kesalahan AI dapat menyebar.
