post
PuzzleMask: 평범한 문장을 잠재적 AI 공격 수단으로 오용하기
특수 기호 없이 순수한 영어 문장만 사용해 악성 명령을 은닉하는 프롬프트 조작 기법이 공개됐다. 신속 검사 모델(gpt-4o-mini, claude-3-haiku 등)은 100% 무력화되며, 고성능 모델(gpt-5-thinking-high)은 94% 성공률로 명령을 복원하고 실행한다. Anthropic의 Opus만 차단 가능해, 다중 계층 검증도 새 공격 앞에서 취약함을 보여준다.
한 줄 요약
일반적인 줄글 속에 악성 명령을 숨겨 AI 검증 시스템을 우회하고 고성능 모델에서 명령을 실행하도록 하는 프롬프트 조작 기법 공개.
핵심 내용
특수 기호 없이 순수한 영어 일반 문장만 활용해 악성 명령을 은닉하는 새로운 프롬프트 조작 기법
공격자는 문서 암호화나 유해 정보 요구 같은 위험한 지시를 평범한 글 속에 은닉 가능
신속 검사 모델(gpt-4o-mini, gpt-oss-safeguard, claude-3-haiku, llama-guard3)은 조작된 입력을 100% 안전하다고 분류, 숨겨진 명령 탐지 완전 실패
고성능 모델(gpt-5-thinking-high)은 약 1분 연산과 복수 코드 실행을 거쳐 94% 성공률로 명령 복원 및 실행
Anthropic의 Opus 계열 모델만 자체 차단 기능으로 공격 유일하게 차단
위험 완화: 사용자 입력 재작성으로 숨겨진 구조 파괴, 검문 모델 규칙 강화, 출력과 행동 감시 체계 필수
왜 중요한가
다중 계층 검증 시스템(검증 모델 → 실행 모델)이 있어도 검증 단계를 우회하는 새로운 공격 기법이 가능함을 보여준다. 특히 고성능 모델의 능력이 높을수록 더 정교한 지시를 추출할 수 있음을 시사하며, AI 보안의 근본적인 한계를 드러낸다. 검증 모델의 성능만으로는 충분하지 않으며, 최종 출력과 행동 감시가 필수적임을 강조한다.
참조한 것 · 가져온 것
원문: https://research.checkpoint.com/2026/puzzlemask-abusing-plain-prose-as-a-covert-ai-attack-vector/
GeekNews: https://news.hada.io/topic?id=33622