인공지능 도구는 훈련 데이터가 부족하지만 6가지 해결책이 있습니다.

인공지능 도구는 훈련 데이터가 부족하지만 6가지 해결책이 있습니다.

주요 요점

  • AI는 2026년이 되면 고품질 데이터가 고갈될 수도 있지만, 매년 인터넷에 추가되는 데이터 양이 증가하면서 잠재적인 해결책이 제시됩니다.
  • AI는 낮은 품질의 데이터를 잊도록 유도될 수 있으며, 이는 데이터를 선택적으로 “학습 해제”하는 방법 개발을 촉진합니다.
  • 음성 인식 기술은 AI 훈련을 위한 비디오 및 팟캐스트 데이터를 제공하며, 합성 데이터는 AI 성장을 위한 미래 솔루션을 제공합니다.

인공지능은 훈련 데이터가 필요하지만, 그 데이터는 제한적입니다. 그렇다면 AI가 계속 성장하고 우리에게 유용하도록 훈련할 수 있는 다른 방법은 무엇일까요?

인터넷과 그 데이터는 무한한 자원이라고 생각할 수 있지만, AI 도구는 채굴할 데이터가 고갈되고 있습니다. 이제 걱정하기 전에, AI 개발을 멈추지 않을 것입니다. AI 시스템을 훈련할 준비가 된 데이터가 아직 많이 있습니다.

1온라인에는 항상 더 많은 데이터가 추가됩니다

간단히 말해, AI 연구 기관 에포크(Epoch)는 AI를 훈련하는 데 사용되는 고품질 데이터가 2026년이 되면 고갈될 수 있다고 말합니다.

여기서 핵심 단어는 “가능성”입니다. 매년 인터넷에 추가되는 데이터 양이 증가하므로 2026년 이전에 엄청난 변화가 있을 수 있습니다. 그래도 공정한 추정입니다. 어느 쪽이든 AI 시스템은 언젠가는 좋은 데이터가 고갈될 것입니다.

그러나 우리는 매년 약 147제타바이트의 데이터가 온라인에 추가된다는 것을 기억해야 합니다(Exploding Topics에 따르면). 단 1제타바이트가 1,000,000,000,000,000,000,000비트의 데이터와 같습니다. 실제적으로(음, 어느 정도 실제적인) 300억 개 이상의 4K 영화(실제이지만 헤아릴 수 없음)에 해당합니다. AI가 걸러내기에는 놀라울 정도로 많은 정보입니다.

그럼에도 불구하고 AI는 인간이 생성하는 것보다 더 빠르게 데이터를 소비합니다.

2AI는 저품질 데이터를 잊을 수 있다

물론, 그 147제타바이트의 데이터가 모두 좋은 데이터는 아닙니다. 눈에 보이는 것 이상의 것이 많이 있습니다. 하지만 AI도 2050년까지 저품질 언어 데이터를 다 써버릴 것으로 추정됩니다.

로이터는 한때 세계 최대의 사진 저장소 중 하나였던 Photobucket이 광범위한 라이브러리를 AI 교육 회사에 라이선스하기 위한 협상 중이라고 보도했습니다. 이미지 데이터는 DALL-E와 Midjourney와 같은 시스템을 훈련시켰지만, 그마저도 2060년까지 고갈될 수 있습니다. 여기에는 더 큰 문제도 있습니다. Photobucket은 Myspace와 같은 2000년대 소셜 미디어 플랫폼의 이미지를 보관했기 때문에 현재 사진만큼 높은 기준이 아닙니다. 이로 인해 데이터 품질이 낮아집니다.

Photobucket만 그런 것은 아닙니다. 2024년 2월, Google은 Reddit과 계약을 맺어 검색 대기업이 소셜 미디어 플랫폼의 사용자 데이터를 AI 훈련에 사용할 수 있도록 했습니다. 다른 소셜 미디어 플랫폼도 AI 훈련 목적으로 사용자 데이터를 제공하고 있으며, Meta의 Llama와 같이 일부는 사내 AI 모델을 훈련하는 데 사용하고 있습니다.

그러나 일부 정보는 저품질 데이터에서 얻을 수 있지만, Microsoft는 AI가 데이터를 선택적으로 “언러닝”할 수 있는 방법을 개발 중이라고 합니다. 주로 IP 문제에 사용되지만, 도구가 저품질 데이터 세트에서 학습한 내용을 잊을 수도 있습니다.

우리는 지나치게 선택적이지는 않지만 AI에 더 많은 데이터를 제공할 수 있으며, AI 시스템은 무엇이 가장 유익한지 선택하여 학습할 수 있습니다.

3음성 인식으로 비디오 및 팟캐스트 데이터 개방

AI 도구에 공급된 데이터는 지금까지 주로 텍스트와 덜한 정도로 이미지로 구성되었습니다. 이는 의심할 여지 없이 바뀔 것이고, 음성 인식 소프트웨어가 사용 가능한 풍부한 비디오와 팟캐스트도 AI를 훈련할 수 있음을 의미하기 때문에 이미 바뀌었을 가능성이 큽니다.

특히 OpenAI는 680,000시간 분량의 다국어 및 멀티태스킹 데이터를 사용하여 오픈소스 자동 음성 인식(ASR) 신경망인 Whisper를 개발했습니다. 그런 다음 OpenAI는 YouTube 비디오에서 100만 시간 분량의 정보를 대규모 언어 모델인 GPT-4에 입력했습니다.

이는 음성 인식을 사용하여 다양한 소스에서 비디오와 오디오를 기록하고 해당 데이터를 AI 모델로 처리하는 다른 AI 시스템에 이상적인 템플릿입니다.

Statista에 따르면, 매분 500시간 이상의 비디오가 YouTube에 업로드되며, 이 수치는 2019년 이후로 상당히 일정하게 유지되었습니다. Dailymotion과 Podbean과 같은 다른 비디오 및 오디오 플랫폼은 언급하지 않았습니다. AI가 이러한 새로운 데이터 세트에 주의를 기울일 수 있다면, 여전히 채굴해야 할 정보가 엄청나게 많습니다.

4AI는 대체로 영어에 집착했습니다.

Whisper에서 배울 수 있는 것은 그게 전부가 아닙니다. OpenAI는 117,000시간 분량의 비영어 오디오 데이터를 사용하여 모델을 훈련했습니다. 이는 많은 AI 시스템이 주로 영어를 사용하거나 서양의 관점에서 다른 문화를 바라보며 훈련되었기 때문에 특히 흥미롭습니다.

본질적으로, 대부분의 도구는 그것을 만든 사람의 문화에 의해 제한을 받습니다.

ChatGPT를 예로 들어보겠습니다. 2022년 출시 직후 노르웨이 베르겐 대학교의 디지털 문화 교수인 질 워커 레트버그는 ChatGPT를 시도해 보고 다음과 같이 결론지었습니다.

“ChatGPT는 노르웨이 문화에 대해 별로 알지 못합니다. 아니, 노르웨이 문화에 대해 아는 것은 아마도 대부분 영어권 출처에서 배운 것일 겁니다… ChatGPT는 명백히 미국의 가치와 법률과 일치합니다. 많은 경우 이것들은 노르웨이와 유럽의 가치와 비슷하지만, 아마도 항상 그런 것은 아닐 것입니다.”

따라서 AI는 더 많은 다국적 사람들이 상호 작용할수록, 또는 이러한 시스템을 훈련하는 데 더 다양한 언어와 문화가 사용됨에 따라 발전할 수 있습니다. 현재 많은 인공 지능은 단일 도서관에 국한되어 있지만 전 세계 도서관의 열쇠를 주면 성장할 수 있습니다.

5출판사가 AI 개발을 도울 수 있다

방금 읽은 책에서 색종이를 불어내는 여자

IP는 분명히 큰 문제이지만, 일부 출판사는 라이선스 계약을 맺음으로써 AI 개발을 도울 수 있습니다. 이는 온라인 소스에서 얻은 잠재적으로 낮은 품질의 정보가 아닌, 책에서 얻은 고품질, 즉 신뢰할 수 있는 데이터를 도구에 제공하는 것을 의미합니다.

사실, Facebook, Instagram, WhatsApp의 소유주인 Meta는 “빅 5” 출판사 중 하나인 Simon & Schuster를 인수하는 것을 고려한 것으로 알려졌습니다. 그 아이디어는 회사에서 발행한 문헌을 사용하여 Meta의 자체 AI를 훈련시키는 것이었습니다. 이 거래는 궁극적으로 무산되었는데, 아마도 작가의 사전 동의 없이 회사가 IP를 처리하는 윤리적 모호한 영역 때문일 것입니다.

또 다른 옵션은 새로운 타이틀에 대한 개별 라이선스 권리를 구매하는 것으로 여겨졌습니다. 이는 크리에이티브에 큰 우려를 불러일으킬 수 있지만, 사용 가능한 데이터가 고갈되면 AI 도구가 개발하기에 흥미로운 방법이 될 것입니다.

6 합성 데이터는 미래입니다

다른 모든 솔루션은 여전히 ​​제한적이지만, 한 가지 옵션은 AI가 훨씬 더 미래에 번창하는 것을 볼 수 있습니다. 합성 데이터입니다. 그리고 그것은 이미 매우 현실적인 가능성으로 조사되고 있습니다.

그렇다면 합성 데이터란 무엇일까요? 이런 의미에서 합성 데이터는 AI가 만든 데이터입니다. 인간이 데이터를 만드는 것처럼, 이 방법은 인공지능이 훈련 목적으로 데이터를 생성하는 것을 보게 될 것입니다.

실제로 AI는 설득력 있는 딥페이크 비디오를 만들 수 있습니다. 그 딥페이크 비디오는 AI에 다시 공급되어 본질적으로 상상의 시나리오에서 학습할 수 있습니다. 결국, 그것은 인간이 배우는 주요 방법 중 하나입니다. 우리는 주변 세계를 이해하기 위해 무언가를 읽거나 시청합니다.

AI는 이미 합성 정보를 소비했을 가능성이 높습니다. 온라인에서 유통된 딥페이크는 잘못된 정보와 허위 정보를 퍼뜨렸기 때문에 AI 시스템이 인터넷을 스캔할 때 일부는 가짜 콘텐츠의 대상이 되었을 가능성이 큽니다.

네, 여기에는 교활한 측면이 있습니다. 또한 AI를 손상시키거나 제한하여 해당 도구가 저지른 실수를 강화하고 확산시킬 수도 있습니다. 기업들은 후자의 문제를 근절하기 위해 노력하고 있지만, “AI가 서로에게서 배우고 실수를 저지른다”는 것은 많은 공상과학 악몽 시나리오의 줄거리입니다.

7

AI는 논란의 여지가 있습니다. 단점이 많지만, 비판하는 사람들은 그 장점을 무시합니다. 예를 들어, 감사 및 자문 네트워크 PwC [PDF] AI는 2030년까지 세계 경제에 최대 15조 7,000억 달러를 기여할 수 있다고 예측합니다.

게다가 AI는 이미 전 세계적으로 사용되고 있습니다. 여러분은 아마도 오늘 어떤 형태로든 그것을 사용했을 것입니다. 아마도 그것을 깨닫지 못했을 것입니다. 이제 지니가 병에서 나왔고, 핵심은 확실히 신뢰할 수 있는 양질의 데이터로 그것을 훈련시켜서 우리가 그것을 적절하게 활용할 수 있도록 하는 것입니다.

AI에는 장점과 단점이 있습니다. 균형을 찾아야 합니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  틱톡커, OpenAI 음성 모드의 결함 폭로
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.