OpenAI가 ChatGPT에 명령 및 프롬프트에 응답할 수 있는 음성을 제공합니다.

OpenAI가 ChatGPT에 명령 및 프롬프트에 응답할 수 있는 음성을 제공합니다.

ChatGPT는 대화형 생성 AI 경험이 될 예정입니다. OpenAI는 세계 최고의 AI 챗봇이 합성된, 아마도 AI가 생성한 음성을 사용하여 말하고 사용자 질문에 응답할 수 있을 것이라고 밝혔습니다.

새롭게 발견된 음성과 함께 ChatGPT는 ChatGPT Android 또는 iOS 앱을 사용하는 동안 업로드되거나 촬영된 특정 이미지에 응답하고 논의할 수도 있습니다. 이미지 인식 기능은 신경망을 사용하여 데이터와 정보를 정확하게 감지하는 Google Lens 및 기타 앱과 유사합니다.

OpenAI가 ChatGPT에 목소리를 주다

2023년 9월 25일, ChatGPT 개발사 OpenAI는 세계 최고의 생성 AI 챗봇에 음성을 부여할 것이라고 밝혔습니다. ChatGPT 사용자는 챗봇에 직접 말하고 다시 말해 달라고 요청할 수 있으며, 이를 통해 ChatGPT가 처음으로 음성으로 직접 대화할 수 있게 되었습니다.

OpenAI의 예시 클립에서는 여성이 ChatGPT에 독특한 취침 이야기를 만들어 달라고 요청하고, ChatGPT는 이에 여성의 합성 음성으로 응답합니다.

https://platform.twitter.com/embed/Tweet.html?creatorScreenName=GavinSpavin&dnt=false&embedId=twitter-widget-0&features=%3D%3D&frame=false&hideCard=false&hideThread=false&id=1706280635055353929&lang=en&origin=https%3A%2F%2 Fwww.makeuseof.com%2Fopenai-chatgpt-새로운-음성-응답-기능-시작%2F&sessionId=a56b5b369daec15ecfbf9a3057bcc00286193cfa&siteScreenName=MUO_official&theme=light&widgetsVersion=2615f7e52b7e0%3A1702314776716&width=550px

에 따르면 열광한새로운 텍스트-음성 모델은 사내에서 개발되었습니다. 텍스트와 몇 초 분량의 샘플 음성(OpenAI Whisper 모델 사용)에서 “인간과 같은” 오디오를 생성하고 다양한 톤과 스타일로 말할 수 있습니다. OpenAI의 블로그에서 다양한 음성 샘플을 찾을 수 있습니다.

일부 회사는 이미 OpenAI의 새로운 음성 모델을 활용하고 있습니다. 예를 들어, Spotify는 OpenAI의 텍스트-음성 모델을 사용하여 팟캐스트를 여러 언어로 번역하고 있으며, ChatGPT의 언어 번역 능력과 새로운 말하기 능력을 결합합니다.

ChatGPT의 새로운 텍스트-음성 변환 모델은 공식 Android 및 iOS 앱을 사용하는 Plus 및 Enterprise 구독자에게만 제공되며 향후 2주(2023년 9월 25일부터 시작) 내에 출시될 예정입니다. 또한 새로운 음성 기능은 처음에는 영어로만 제한되지만 빠르게 바뀔 것으로 예상됩니다.

ChatGPT는 이미지와 사진을 인식하고 분석할 수 있습니다

OpenAI의 ChatGPT 업데이트의 두 번째 부분은 도구에 업로드된 이미지를 분석하고 대화하는 기능입니다. 시각적 이미지 분석 옵션은 GPT-4 업데이트 비디오에 소개되었지만 그 이후로는 별로 논의되지 않았습니다(ChatGPT 코드 인터프리터 제외).

https://platform.twitter.com/embed/Tweet.html?creatorScreenName=GavinSpavin&dnt=false&embedId=twitter-widget-1&features=%3D%3D&frame=false&hideCard=false&hideThread=false&id=1706280618429141022&lang=en&origin=https%3A%2F%2 Fwww.makeuseof.com%2Fopenai-chatgpt-새로운-음성-응답-기능-시작%2F&sessionId=a56b5b369daec15ecfbf9a3057bcc00286193cfa&siteScreenName=MUO_official&theme=light&widgetsVersion=2615f7e52b7e0%3A1702314776716&width=550px

이제 ChatGPT는 Google Lens와 유사한 기능을 얻습니다. ChatGPT에 이미지를 업로드하거나 ChatGPT 앱에서 스마트폰 카메라를 사용하여 사진을 찍으면 이미지를 자세히 설명하고 필요한 경우 더 많은 맥락을 추가합니다.

“Google 렌즈와 비슷하다”고 부르는 건 정말 불공평합니다. 이미지에 대해 앞뒤로 채팅하여 더 많은 정보와 맥락을 얻을 수 있는 기능은 광범위한 설정에 매우 유용합니다. 그러나 OpenAI가 개인정보 보호 및 정확성을 이유로 ChatGPT의 “사람에 대한 분석 및 직접적인 진술 능력”을 제한했다고 분명히 밝힌 미세한 글자를 주의해서 보는 것이 중요합니다. 그래도 OpenAI 기반 “Who Is This” 도구가 미래에 개발될 수 있을까요? (그럴 리가 없겠죠!)

새로운 텍스트-음성 모델과 마찬가지로 OpenAI는 향후 2주 안에 이미지 인식 기능을 출시할 예정이며, ChatGPT 앱뿐만 아니라 모든 플랫폼에서 사용 가능할 예정입니다.

개인정보 보호, 보안 및 기타 문제

음성 기반 ChatGPT의 의미는 엄청납니다. 물론, 흥미진진합니다. 그러나 짧은 스니펫을 예로 들어 고유하게 합성된 음성을 만드는 능력에는 상당한 개인 정보 보호 및 보안 문제가 있습니다. 악의적인 행위자가 이러한 도구를 악용할 가능성은 엄청나며, 모든 생성 AI 도구와 마찬가지로 지니가 병에서 나오면 절대 다시 들어갈 수 없습니다. 정부나 사상적 리더가 아무리 AI를 규제하더라도 조류를 되돌릴 수는 없습니다.

OpenAI가 이 주제에 대해 경고한 내용도 문제를 언급했음에도 불구하고 당연한 내용을 피하는 듯합니다.

그러나 이러한 기능은 악의적인 행위자가 공인을 사칭하거나 사기를 저지를 가능성과 같은 새로운 위험도 제공합니다. 이것이 우리가 이 기술을 사용하여 특정 사용 사례인 음성 채팅을 구동하는 이유입니다.

이게 빙산의 일각에 불과하다는 점을 감안하면 ChatGPT의 새로운 목소리에 대한 반발이 예상되며, 특히 ChatGPT가 사기를 저지르는 데 사용되고 있다는 등의 불쾌한 헤드라인이 예상대로 늘어나면 더욱 그렇습니다.

OpenAI가 ChatGPT를 Go-To AI 앱으로 만듭니다.

OpenAI가 ChatGPT에 사용자 친화적인 기능을 더 많이 추가할수록, ChatGPT는 필수 생성 AI 앱이 됩니다. 초기 생성 AI 붐 동안 널리 유명해진 최초의 앱인 ChatGPT는 여전히 선두를 달리고 있으며, Google Bard(그리고 잠재적으로 Google Gemini)와 Anthropic의 Claude와 같은 경쟁에도 불구하고 일부 사람들이 사용하는 유일한 앱입니다.

OpenAI가 ChatGPT를 사용하기 쉽게 만드는 기능을 계속 추가할 수만 있다면, 사람들은 계속 관심을 갖고 진정한 멀티모달 AI 도구라는 목표에 한층 더 다가갈 수 있을 것입니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  고블린에 대해 절대 말하지 마세요: OpenAI Codex의 이상한 괴물 금지 규칙
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.