위키백과, AI 봇 과다 대응을 위한 데이터셋 생성

위키백과, AI 봇 과다 대응을 위한 데이터셋 생성

위키미디어 재단, AI 최적화 위키피디아 데이터셋 출시를 위해 카글과 파트너십 체결

수요일, 위키미디어 재단은 데이터 과학 협업의 선도 플랫폼인 구글 소속의 카글과의 파트너십을 발표하며, AI 모델 학습을 위해 특별히 최적화된 위키피디아의 선별된 버전을 출시한다고 밝혔다. 이 사업은 처음에 영어와 프랑스어에 초점을 맞추어, 마크다운이나 참고 요소가 없는 위키피디아 기사들의 간소화된 원문 텍스트를 제공한다.

위키피디아: AI 혁신을 위한 비영리 리소스

자원봉사자 주도의 비영리 플랫폼인 위키피디아는 기부를 통해 자금을 조달하며, 호스팅하는 콘텐츠에 대한 소유권을 주장하지 않는다. 이러한 독특한 구조는 광범위한 지식 기반의 무제한 사용 및 리믹스를 허용하며, 북한과 같은 지역에서 중요한 정보를 전파하기 위해 활용되는 오프라인 버전 위키피디아인 키윅스와 같은 이니셔티브를 촉진한다.

비인간 트래픽 및 대역폭 문제 해결

그렇지만, AI 훈련을 위해 웹 페이지를 계속 크롤링하는 봇의 대규모 급증은 위키피디아에 대한 비인간 트래픽의 급격한 증가를 초래했으며, 재단은 증가하는 운영 비용으로 인해 이를 완화하는 것을 목표로 하고 있다. 이전 이달 초, 재단은 2024년 1월 이후 대역폭 소비가 50% 늘어났다고 보고했다. 표준 JSON 형식의 데이터셋을 제공함으로써 위키미디어 재단은 AI 개발자들이 서버에 과부하를 주지 않도록 희망하고 있다.

카글: 접근 가능한 AI 데이터의 촉매제

브렌다 플린 카글 파트너십 책임자는 이 이니셔티브에 대한 열정을 표현하며 “기계 학습 커뮤니티가 도구와 테스트를 위해 오는 곳으로서, 카글은 위키미디어 재단의 데이터를 호스팅하게 되어 매우 기쁘다. 카글은 이 데이터를 접근 가능하고 유용하게 유지하는 데 기여할 수 있기를 기대한다.”고 더 버지에 말했다.

AI 훈련 데이터에 대한 윤리적 논쟁

기술 산업은 오랫동안 다른 사람이 생성한 콘텐츠를 사용하여 AI를 훈련시키는 것의 의미에 대해 고민해왔다. 모든 콘텐츠가 자유롭게 이용되어야 한다는 의견이 증가하고 있으며, 일부는 온라인 자료를 AI 훈련에 사용하는 것이 AI 모델의 변형 가능성으로 인해 공정 사용에 해당한다고 주장한다. 그러나 원본 콘텐츠 제작자들은 자신의 작업을 제작하는 데 비용과 노력을 지불한다는 점을 기억하는 것이 중요하다.

많은 AI 스타트업들은 웹 사이트 콘텐츠의 자동 스크래핑을 제한하는 규범을 무시했다. 인간과 유사한 텍스트를 생성하는 언어 모델은 효과적으로 개발하기 위해 광범위한 데이터셋이 필요하며, 이로 인해 AI 혁명 기간 동안 유가의 가치와 유사한 질 높은 훈련 자료에 대한 치열한 경쟁이 발생하고 있다. 주요 모델들은 종종 저작권이 있는作品으로 훈련되고 있으며, 많은 AI 회사들이 이러한 관행에 대해 진행 중인 소송에 연루되어 있다. Chegg과 Stack Overflow와 같은 기업에게는 AI 회사들이 그들의 콘텐츠를 활용하면서 출처로 돌아가는 웹 트래픽을 전달하지 않을 위험이 있다.

크리에이티브 커먼즈 라이선스: 접근성과 권리의 균형

일부 위키피디아 기여자들은 자신의 기여가 AI 훈련에 사용되는 것에 저항할 수 있지만, 모든 콘텐츠는 크리에이티브 커먼즈 저작자표시-동일조건변경허용 라이선스 하에 제공된다는 것을 인식하는 것이 중요하다. 이 라이선스는 원본 제작자가 크레딧을 받을 경우 누구나 작업을 자유롭게 공유, 수정 및 활용할 수 있도록 허용하며, 상업적 목적을 포함하여 동형 저작물도 유사하게 라이선스를 부여해야 한다.

카글에서의 위키피디아 AI 데이터셋 무료 접근

카글에서 호스팅되는 데이터셋은 개발자에게 무료로 제공된다. 위키미디어 재단은 기고한 Gizmodo에게 카글이 “구조화된 콘텐츠”를 위한 베타 프로그램을 통해 위키피디아 데이터셋을 활용하고 있다고 밝혔다. 이는 콘텐츠 재사용을 원활히 하기 위한 고용량 사용자들을 위한 프리미엄 서비스인 위키피디아 엔터프라이즈 제품군의 일부이다. 재단은 AI 모델 개발자들이 이 콘텐츠를 재사용할 경우 위키피디아의 저작권 및 라이선스 요구 사항을 준수해야 한다고 강조한다.

FAQ: 위키피디아와 카글의 파트너십 이해하기

카글과 위키미디어의 파트너십 목적은 무엇인가요?

이 파트너십의 목적은 AI 모델 훈련을 지원하기 위해 특별히 설계된 위키피디아 텍스트 데이터의 정제된 버전을 만드는 것이며, AI 트래픽 관련 대역폭 문제를 해결하는 동시에 접근성을 향상시키는 것이다.

개발자는 카글에서 위키피디아 데이터셋에 어떻게 접근하나요?

개발자는 카글에서 무료로 데이터셋에 접근할 수 있다. 이 데이터셋은 기계 학습 프로젝트에 쉽게 통합할 수 있도록 구조화되어 있으며, 고용량 사용자들을 대상으로 한 베타 프로그램을 통해 제공된다.

위키피디아에서 제공되는 콘텐츠의 라이선스는 무엇인가요?

위키피디아의 모든 콘텐츠는 크리에이티브 커먼즈 저작자표시-동일조건변경허용 라이선스 하에 라이선스되어 있으며, 원본 제작자가 크레딧을 받는 조건 하에 자유롭게 공유 및 수정할 수 있다. 파생 저작물은 유사하게 라이선스가 부여되어야 한다.

대역폭 관리가 왜 위키피디아에 중요한가요?

AI 봇이 위키피디아에 접근하는 것이 크게 증가한 결과 대역폭 소모가 급증했고, 이는 재단의 운영 비용을 증가시키고 있다. 최적화된 데이터셋을 제공함으로써 재단은 이러한 문제를 완화하고자 한다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  AI 딥페이크 탐지: 거의 완벽한 정확도를 위한 6가지 핵심 특징