GPTBot은 무엇이며 웹 사이트가 왜 차단하고 있습니까?

GPTBot은 무엇이며 웹 사이트가 왜 차단하고 있습니까?

주요 요점

  • OpenAI의 GPTBot은 공개 웹사이트에서 데이터를 수집하도록 설계된 웹 크롤러로, 이 데이터를 사용하여 GPT-4 및 ChatGPT와 같은 AI 모델을 훈련하고 개선합니다.
  • 인터넷의 일부 대형 웹사이트에서는 GPTBot을 차단하고 있습니다. GPTBot은 제작자에게 허가나 보상 없이 저작권이 있는 콘텐츠에 접근하여 사용하기 때문입니다.
  • 웹사이트에서는 robots.txt와 같은 도구를 사용하여 GPTBot을 차단할 수 있지만 OpenAI가 이를 준수할 것이라는 보장은 없으므로 저작권이 있는 데이터에 대한 액세스를 제어할 수 있습니다.

2023년 8월, ChatGPT를 개발한 것으로 알려진 AI 강자 OpenAI가 웹을 탐색하고 데이터를 수집하도록 설계된 웹 크롤러인 GPTBot을 발표했습니다.

그 발표가 있은 지 얼마 지나지 않아 인터넷의 가장 큰 웹사이트 중 일부가 봇이 웹사이트에 접근하는 것을 차단했습니다. 하지만 왜 그럴까요? OpenAI의 GPTBot은 무엇일까요? 왜 큰 웹사이트들이 그것을 두려워하고, 왜 그것을 차단하려고 할까요?

OpenAI의 GPTBot은 무엇인가요?

Black Box를 이용한 AI 그래픽 그림

GPTBot은 OpenAI가 인터넷을 검색하고 OpenAI의 AI 개발 목표를 위한 정보를 수집하기 위해 만든 웹 크롤러입니다. 공개 웹사이트를 크롤링하고 데이터를 OpenAI 서버로 다시 보내도록 프로그래밍되어 있습니다. 그런 다음 OpenAI는 이 데이터를 사용하여 점점 더 진보된 인공 지능 시스템을 구축하는 목표로 AI 모델을 훈련하고 개선합니다. GPT-4 또는 ChatGPT와 같은 자식 제품과 같은 정교한 AI 모델을 구축하려면 웹 크롤러가 거의 필수적입니다.

AI 모델을 훈련하려면 엄청난 양의 데이터가 필요하며, 이 데이터를 수집하는 가장 효과적인 방법 중 하나는 웹 크롤러와 같은 도구를 배포하는 것입니다. 크롤러는 체계적으로 웹을 탐색하고, 링크를 따라가서 방대한 양의 웹페이지를 색인하고, 사전 정의된 패턴과 일치하는 텍스트, 이미지, 메타데이터와 같은 핵심 데이터를 추출할 수 있습니다.

그런 다음 이 데이터를 구조화하여 AI 모델에 공급하여 자연어 처리 능력이나 이미지 생성 능력을 훈련하거나 다른 AI 작업을 위해 훈련할 수 있습니다. 즉, 웹 크롤러는 ChatGPT나 DALL-E와 같은 도구가 수행하는 작업을 가능하게 하는 데이터를 수집합니다.

웹 크롤러는 새로운 개념이 아닙니다. 오늘날 인터넷에서 사용할 수 있는 수십억 개의 웹사이트를 크롤링하는 크롤러는 수백만 개가 있을 것입니다. 그리고 그들은 적어도 90년대 초반부터 존재해 왔습니다. GPTBot은 OpenAI가 소유한 그런 크롤러 중 하나일 뿐입니다. 그렇다면 이 특정 웹 크롤러를 둘러싼 논란의 원인은 무엇일까요?

대형 기술 사이트가 GPTBot을 차단하는 이유는 무엇입니까?

도로변에 있는 정지 표지판

Business Insider에 따르면, 인터넷에서 가장 큰 웹사이트 중 일부는 자사 웹사이트에서 OpenAI의 크롤러를 적극적으로 차단하고 있습니다. 그렇다면 GPTBot의 궁극적인 목표가 AI 개발을 발전시키는 것이라면, 어떤 식으로든 AI로부터 혜택을 받은 인터넷에서 가장 큰 사이트 중 일부가 GPTBot에 반대하는 이유는 무엇일까요?

글쎄요, 문제는 이겁니다. 2022년 생성 AI 기술이 부활한 이래로, AI 회사가 인터넷에서 얻은 데이터를 거의 제한 없이 사용할 권리에 대한 수많은 논쟁이 있었습니다. 이 중 상당 부분은 저작권으로 법적으로 보호받습니다. 이러한 회사가 자신의 이익을 위해 데이터를 수집하고 사용하는 방법을 규제하는 명확한 법률은 없습니다.

인공지능 여성

기본적으로 GPTBot과 같은 크롤러는 웹을 크롤링하고 사람들의 창작물을 텍스트, 이미지 또는 다른 형태의 미디어 형태로 수집한 다음 원래 제작자에게 어떠한 허가, 라이선스 또는 보상을 제공하지 않고 상업적 목적으로 사용합니다.

밖은 서부 개척 시대이고, AI 회사들은 손에 넣을 수 있는 것은 무엇이든 움켜쥐고 있습니다. Quora, CNN, New York Times, Business Insider, Amazon과 같은 대형 웹사이트는 저작권이 있는 콘텐츠가 이러한 크롤러에 의해 수집되는 것을 별로 좋아하지 않습니다. 그래서 OpenAI는 그들의 비용으로 재정적 이익을 얻을 수 있습니다.

그래서 이러한 사이트는 웹 크롤러를 차단하는 수십 년 된 방법인 “robots.txt”를 배포하고 있습니다. 오픈AIGPTBot은 robots.txt에 내장된 규칙에 따라 웹사이트를 크롤링하거나 크롤링하지 않도록 하는 지침을 따릅니다. robots.txt는 웹 크롤러가 사이트에서 어떻게 행동해야 하는지 알려주는 작은 텍스트 파일입니다. 자신의 사이트가 있고 GPTBot이 데이터를 수집하는 것을 막고 싶다면 OpenAI의 크롤러가 웹사이트를 스크래핑하는 것을 차단하는 방법은 다음과 같습니다.

웹사이트가 정말로 GPTBot을 막을 수 있을까?

GPTBot과 같은 크롤러는 고급 AI 시스템을 훈련하는 데 필요한 엄청난 양의 데이터를 수집하는 데 없어서는 안 될 요소이지만, 무시할 수 없는 저작권과 공정 사용에 대한 우려가 있습니다.

물론, 이를 방지하기 위해 사용할 수 있는 robots.txt와 같은 간단한 도구가 있지만 GPTBot이 이 파일의 지침을 따르는지 여부는 전적으로 OpenAI의 재량에 달려 있습니다. 그렇게 할 것이라는 보장은 없으며 그렇게 했는지 여부를 알 수 있는 즉각적인 확실한 방법도 없습니다. GPTBot을 저작권이 있는 데이터에서 멀리 떨어뜨리려는 싸움에서 OpenAI는 적어도 지금은 에이스를 보유하고 있습니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  스페이스X 역사적인 순간: 역대 최대 IPO, SPCX로 거래 시작