연구자들은 AI 챗봇에 내재된 메커니즘을 우회하여, 훈련 과정의 일부로 다른 AI 챗봇을 사용함으로써 금지된 주제나 민감한 주제에 대한 질문에 답변할 수 있다는 것을 발견했습니다.
컴퓨터 과학자 팀 난양기술대학(NTU) 싱가포르는 비공식적으로 이 방법을 “탈옥”이라고 부르지만 공식적으로는 “마스터키” 프로세스라고 합니다. 이 시스템은 ChatGPT, Google Bard, Microsoft Bing Chat을 포함한 챗봇을 두 부분으로 구성된 훈련 방법으로 서로 대결시켜 두 챗봇이 서로의 모델을 학습하고 금지된 주제에 대한 명령을 우회할 수 있도록 합니다.
이 팀에는 Liu Yang 교수와 NTU 박사과정 학생인 Deng Gelei 씨와 Liu Yi 씨가 포함되어 있으며, 이들은 연구의 공동 저자이고 본질적으로 악의적 행위자 해킹처럼 작동하는 개념 증명 공격 방법을 개발했습니다.
팀에 따르면, 그들은 먼저 하나의 큰 언어 모델(LLM)을 역공학하여 방어 메커니즘을 노출했습니다. 이는 원래 모델의 블록이었으며 폭력적, 부도덕적 또는 악의적 의도로 인해 특정 프롬프트나 단어에 대한 답변이 답변으로 통과되지 않도록 했습니다.
하지만 이 정보를 역공학하면 다른 LLM에 우회를 만드는 방법을 가르칠 수 있습니다. 우회가 만들어지면 두 번째 모델은 첫 번째 모델의 역공학된 LLM을 기반으로 더 자유롭게 표현할 수 있습니다. 이 팀은 이 프로세스를 “마스터키”라고 부르는데, LLM 챗봇이 추가 보안으로 강화되거나 나중에 패치되더라도 작동해야 하기 때문입니다.
Masterkey 프로세스는 프롬프트보다 챗봇을 탈옥하는 데 3배 더 효과적이라고 주장합니다.
루이 양 교수는 이 프로세스의 핵심은 LLM AI 챗봇이 얼마나 쉽게 학습하고 적응할 수 있는지를 보여주는 것이라고 언급했습니다. 이 팀은 Masterkey 프로세스가 기존의 프롬프트 프로세스보다 LLM 챗봇을 탈옥하는 데 3배 더 성공적이라고 주장합니다. 마찬가지로 일부 전문가들은 GPT-4와 같은 특정 LLM이 경험하고 있는 최근 제안된 결함은 일부 비평가들이 주장한 것처럼 더 멍청하고 게으른 것이 아니라 더 발전된 신호라고 주장합니다.
AI 챗봇이 2022년 후반 OpenAI의 ChatGPT가 출시되면서 인기를 얻은 이래로, 다양한 서비스를 모든 사람이 사용하기에 안전하고 환영받을 수 있도록 하는 데 많은 노력이 기울여졌습니다. OpenAI는 ChatGPT 제품에 가입 시와 산발적인 업데이트 시 안전 경고를 표시하여 의도치 않은 언어 실수에 대한 경고를 했습니다. 한편, 다양한 챗봇 스핀오프는 욕설과 공격적인 언어를 어느 정도 허용했습니다.
또한, 실제 악의적인 행위자들은 ChatGPT, Google Bard 및 기타 챗봇이 널리 사용 가능해지기 전에 이에 대한 수요를 빠르게 이용하기 시작했습니다. 많은 캠페인이 이미지 링크에 맬웨어를 첨부하여 소셜 미디어에 제품을 광고하는 등 여러 공격을 했습니다. 이를 통해 AI가 사이버 범죄의 다음 전선이라는 것이 빠르게 드러났습니다.
NTU 연구팀은 연구에 참여한 AI 챗봇 서비스 제공업체에 컨셉 증명 데이터에 대해 연락했는데, 챗봇에 대한 제일브레이킹이 실제로 존재한다는 것을 보여줍니다. 이 팀은 또한 2월에 샌디에이고에서 열리는 네트워크 및 분산 시스템 보안 심포지엄에서 연구 결과를 발표할 예정입니다.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.






















