EVALUASI KEAMANAN PROMPT DALAM INTERAKSI MANUSIA DAN AI: STUDI KASUS PADA MODEL GPT-4

Authors

  • Herman Santoni Universitas Muhammadiyah Surakarta

DOI:

https://doi.org/10.51878/academia.v6i4.13904

Keywords:

Keamanan Prompt, Interaksi Manusia dan AI, GPT-4, LLM, Keamanan Sistem AI

Abstract

ABSTRACT

The rapid development of generative artificial intelligence, particularly language models such as GPT-4, has transformed human–machine interaction through the use of prompts across various contexts. However, the adaptive capabilities of these models introduce security challenges, particularly those involving prompt injection, output manipulation, behavioral constraint bypassing, and potential data breaches. This study aims to analyze the security dimensions of prompt-based interaction with GPT-4 and to identify its vulnerabilities and the effectiveness of the implemented mitigation mechanisms. A case study method was employed through several stages, including the design and testing of various types of manipulative prompts, observation of model responses, identification of deviations from security constraints, and evaluation of the available security filters and behavioral restrictions. The findings indicate that security filters and behavioral constraints implemented in GPT-4 can reduce certain risks associated with harmful interactions, but they do not completely prevent more sophisticated prompt-engineering strategies. These vulnerabilities demonstrate that the security of language-model-based systems cannot rely solely on built-in protection mechanisms but requires layered risk mitigation strategies, continuous security evaluation, and improved user awareness. The study concludes that strengthening security frameworks, conducting systematic testing against manipulative scenarios, and promoting safe and ethical AI usage practices are necessary to improve the resilience of prompt-based AI systems.

ABSTRAK

Perkembangan kecerdasan buatan generatif, khususnya model bahasa seperti GPT-4, telah mengubah pola interaksi manusia dan mesin melalui penggunaan perintah (prompt) dalam berbagai konteks. Namun, kemampuan model dalam memahami dan menghasilkan respons secara adaptif menimbulkan tantangan keamanan, terutama terkait injeksi perintah, manipulasi keluaran, pengabaian batasan perilaku, dan potensi pelanggaran data. Penelitian ini bertujuan menganalisis dimensi keamanan interaksi berbasis perintah pada GPT-4 serta mengidentifikasi kerentanan dan efektivitas mekanisme mitigasi yang diterapkan. Penelitian menggunakan metode studi kasus dengan tahapan berupa perancangan dan pengujian berbagai jenis perintah manipulatif, pengamatan terhadap respons model, identifikasi bentuk penyimpangan dari batasan keamanan, serta evaluasi terhadap filter dan mekanisme pembatasan perilaku yang tersedia. Hasil penelitian menunjukkan bahwa penerapan filter keamanan dan pembatasan perilaku pada GPT-4 mampu mengurangi sebagian risiko interaksi berbahaya, tetapi belum sepenuhnya mencegah strategi rekayasa perintah yang lebih kompleks. Kerentanan tersebut menunjukkan bahwa keamanan sistem berbasis model bahasa tidak hanya bergantung pada mekanisme perlindungan bawaan, tetapi juga memerlukan strategi mitigasi berlapis, evaluasi keamanan secara berkelanjutan, dan peningkatan kesadaran pengguna. Penelitian ini menyimpulkan bahwa penguatan kerangka kerja keamanan, pengujian terhadap skenario manipulatif, dan penerapan praktik penggunaan AI yang aman dan etis diperlukan untuk meningkatkan ketahanan sistem AI berbasis perintah.

Downloads

Download data is not yet available.

References

Abdillah, M. L., & Hardiani, T. (2026). SAST implementation for evaluating LLM-generated code quality using prompt engineering. Sistemasi: Jurnal Sistem Informasi, 15(5), 1873–1885. https://sistemasi.ftik.unisi.ac.id/index.php/stmsi/article/view/6395

Albrethsen, J., Datta, Y., Kumar, K., & Rajasekar, S. (2026). Deepcontext: Stateful real-time detection of multi-turn adversarial intent drift in LLMs. arXiv.

https://arxiv.org/abs/2602.16935

Correia, P. H. B., Achjian, R. W., De Oliveira, D. E., Maria, Y. A., Hayashi, V. T., Lopes, M., & Simplicio, M. A. (2026). A systematic literature review on LLM defenses against prompt injection and jailbreaking: Expanding NIST taxonomy. arXiv.

https://arxiv.org/abs/2601.22240

Geng, T., Xu, Z., Qu, Y., & Wong, W. E. (2026). Prompt injection attacks on large language models: A survey of attack methods, root causes, and defense strategies. Computers, Materials & Continua, 87(1), 4. https://doi.org/10.32604/cmc.2025.074081

Haromain, I., Munir, S., & Rahmah, A. (2025). Analisa prompt engineering pada large language model dengan retrieval-augmented generation untuk informasi obat dan vitamin. Indonesian Journal of Computer Science, 4(2), 144–153.

https://jurnal.bsi.ac.id/https:/jurnal.bsi.ac.id/index.php/ijcs/article/view/10005

Irwandi, H., Silitonga, A. I., Chandra, R., & Simamora, W. S. (2026). Security evaluation of Indonesian LLMs for digital business using STAR prompt injection. Sinkron: Jurnal dan Penelitian Teknik Informatika, 10(1), 449–457.

https://doi.org/10.33395/sinkron.v10i1.15662

Jimmy, J. (2026). Analisis kerentanan keamanan pada integrasi API generative AI dalam aplikasi berbasis web. Jurnal Minfo Polgan, 15(2), 2128–2137.

https://doi.org/10.33395/jmp.v15i2.16567

Joseph, J. K., Daniel, E., Kathiresan, V., & MAP, M. (2025). Prompt injection in large language model exploitation: A security perspective. In 2025 International Conference on Electronics, Computing, Communication and Control Technology (ICECCC) (pp. 1–8). IEEE. https://ieeexplore.ieee.org/abstract/document/11064209

Knowlton, B., Campa, J., Gallo, D. S., Dajani, K., & Alzahrani, N. (2026). Prompt-based jailbreaking of leading LLM chatbots: A survey of attacks and defenses. IEEE Transactions on Artificial Intelligence.

https://ieeexplore.ieee.org/abstract/document/11397677

Kuncoro, A. W., Fayruz Rahma, S. T., & Eng, M. (2022). Analisis metode Open Web Application Security Project (OWASP) pada pengujian keamanan website: Literature review. Automata, 3(1). https://journal.uii.ac.id/automata/article/view/21893

Maulida, R. (2024). Komparasi respons ChatGPT dan Gemini terhadap command pattern identik dengan metode black box. Jurnal Teknik Informatika STMIK Antar Bangsa, 10(2), 68–71. https://doi.org/10.51998/jti.v10i2.588

Mittal, A., Kaur, J., & Chatterjee, T. K. (2026). A systematic review of jailbreaking attacks and defense mechanisms in large language models. In 2026 International Conference on Sustainable Engineering and Technology Innovations (ICSETI) (pp. 507–512). IEEE. https://ieeexplore.ieee.org/abstract/document/11636629

Rachmat, N., & Kesuma, D. P. (2024). Implementasi LLM Gemini pada pengembangan aplikasi chatbot berbasis Android. Jurnal Ilmu Komputer (JUIK), 4(1), 40–52.

https://journal.umgo.ac.id/index.php/juik/article/view/2831

Ramdhon, A. N. (2026). Dari prompt ke produksi: Metode tiga dimensi untuk mengevaluasi keselarasan niat, keandalan kode, dan kognisi pengembang dalam vibe coding. SABER: Jurnal Teknik Informatika, Sains dan Ilmu Komunikasi, 4(2), 62–77.

https://doi.org/10.59841/saber.v4i2.3716

Rani, H. A., Ismail, A., Jaa'far, M. H., & Ahmad, N. (2025). Risks, incidents, guidelines, and strategies pertaining to chemical storage and handling in primary healthcare: A narrative review. International Journal of Public Health Research, 15(2), 2366–2374.

https://spaj.ukm.my/ijphr/index.php/ijphr/article/view/543

Razan, K. F. A., Nidji, M. F., & Hasanah, A. U. (2026). Pemetaan tematik pengembangan chatbot AI multibahasa: Tinjauan literatur sistematis terhadap tren dan tantangan masa depan. Jurnal Riset Teknik Komputer, 3(1), 31–43. https://doi.org/10.69714/yd129k17

Sumadewa, I. N. Y., Anggrawan, A., Hairani, H., Hariyadi, I. P., Satria, C., & Saputri, D. S. C. (2025). Emotion classification on customer reviews of drinking water services using IndoBERT and machine learning algorithms. In 2025 7th International Conference on Cybernetics and Intelligent System (ICORIS) (pp. 1–5). IEEE.

https://ieeexplore.ieee.org/abstract/document/11296077

Sun, X., Zhang, D., Yang, D., Zou, Q., & Li, H. (2024). Multi-turn context jailbreak attack on large language models from first principles. arXiv. https://arxiv.org/abs/2408.04686

Yi, S., Liu, Y., Sun, Z., Cong, T., He, X., Song, J., ... & Li, Q. (2024). Jailbreak attacks and defenses against large language models: A survey. arXiv preprint arXiv:2407.04295.

https://arxiv.org/abs/2407.04295

Yusuf, R., Perdana, A., Sugandi, F., & Apsiswanto, U. (2025). Kajian konseptual AI agent on-chain berbasis LLM untuk manajemen aset DeFi. Journal of Technology and Data Science, 3(2), 216–228. https://doi.org/10.59025/ef9b943c

Downloads

Published

2026-09-07

How to Cite

Santoni, H. (2026). EVALUASI KEAMANAN PROMPT DALAM INTERAKSI MANUSIA DAN AI: STUDI KASUS PADA MODEL GPT-4. ACADEMIA: Jurnal Inovasi Riset Akademik, 6(4), 3101–3109. https://doi.org/10.51878/academia.v6i4.13904

Issue

Section

Articles