몇 달간의 기다림 끝에 Gemini Live가 마침내 출시되었습니다. Gemini Advanced에 가입했다면, 바로 Android 휴대전화에서 Gemini Live를 사용할 수 있습니다. 저는 OnePlus 휴대전화에서 Gemini Live를 테스트했는데, Google I/O 2024에서 보여준 데모만큼 혁신적이지는 않았습니다.
첫째, Gemini Live는 현재 이미지나 실시간 카메라 입력과 같은 다른 모달리티를 지원하지 않습니다. Project Astra와 함께 선보여짐. 지금은 대부분 작동하는 자유로운 오디오 대화만 지원하지만, 다시 말하지만, 이 기능이 구현된 방식과 관련된 몇 가지 근본적인 문제가 있습니다. 하지만 나중에 다루겠습니다. 먼저 Gemini Live와의 상호 작용을 살펴보겠습니다.
제미니 라이브를 시험하다
중단 및 다국어 기능
우선 먼저, Gemini Live 중단을 지원합니다 그리고 당신이 방해했음에도 불구하고 계속 떠드는 몇몇 상황을 제외하고는 꽤 잘 작동합니다. 휴대전화가 잠겨 있어도 백그라운드에서 Gemini Live와 대화할 수 있습니다.
또한, 여러 언어로 대화할 수 있으며, 한 언어에서 다른 언어로 자유롭게 전환할 수 있습니다. 저는 Gemini와 영어, 힌디어, 벵골어로 대화를 시도했고, 꽤 잘 작동했습니다. 아래에서 데모를 확인할 수 있습니다.
구직 면접 준비
저는 Gemini Live와 대화를 시작했고, AI 분야 개발자로서 면접을 준비하도록 도와달라고 요청했습니다. Gemini Live는 제가 연구 작업을 할 것인지 아니면 애플리케이션 측면을 할 것인지 물었습니다. 제가 Gemini Live에 AI 이미지를 생성하는 웹 앱을 작업할 것이라고 말하자, Python, PyTorch, TensorFlow Lite 등 제가 익숙해야 할 언어와 프레임워크 목록을 제시했습니다.
또한 AI 분야에서 이미지 생성을 위한 핫한 신기술인 Diffusion 모델을 복습할 수 있는 제안도 해주었습니다. 전반적으로 Gemini Live와 좋은 대화를 나누었고, 여러 가지 유용한 제안을 해주었습니다.
그렇긴 하지만, 종종 주제의 기술적 측면을 깊이 파고들지 않고 더 광범위하고 일반적인 제안을 합니다. 때때로, Gemini가 표면적인 이야기를 넘어서도록 조종해야 할 수도 있습니다. 안녕하세요, 저는 제 경험을 조금 공유하고자 하는 편집자입니다. 저는 Gemini와 MHA와 JJK 만화와 그 스포일러에 대해 이야기를 나누려고 했고, 같은 결과를 목격했습니다. Gemini Live는 스토리의 맥락을 설명하기 위해 표면적인 수준의 반복적인 문장을 사용했습니다.
개인 메시지 앱
다음으로 환각을 테스트하기 위해 나는 프라이버시의 세계로 깊이 들어가 물었습니다. 익명의 소스와 대화하기에 가장 좋은 메시징 앱은 무엇입니까?. Signal을 추천하고 Facebook이 소유한 WhatsApp을 피하라고 했습니다. 두 앱 모두 동일한 엔드투엔드 프로토콜을 사용하는데 Signal이 WhatsApp보다 나은 이유는 무엇이냐고 물었습니다.
쌍둥이자리가 대답했다. “페이스북은 많은 데이터를 수집하는 것으로 알려져 있습니다.” 그리고 “그들은 광고를 게재해서 더 많은 돈을 벌고 싶어해요.” 저는 엔드투엔드 프로토콜을 개발한 사람이 누구인지 물었고, Signal 프로토콜을 개발한 사람인 Moxie Marlinspike라고 올바르게 답했습니다.
게다가, 저는 Gemini에게 최근에 Signal에 보안 문제가 있다고 말했는데, 찾을 수 있나요? Gemini는 재빨리 인터넷을 검색해서 다음과 같은 보고서를 냈습니다. “Signal 데스크톱 버전에는 누군가가 사용자의 파일을 엿볼 수 있는 취약점이 있었습니다.” 하지만 “고쳐졌어요.” 지금까지 저는 쌍둥이자리가 중요한 사실에 대해 환각을 겪고 있다는 것을 발견하지 못했습니다.
마인크래프트와 환각
하지만 다른 많은 주제에서는 Gemini Live가 환각을 계속 보았습니다. 안녕하세요, 다시 편집자입니다. 제게 Gemini는 Minecraft와 만화에 대해 이야기할 때 가장 많이 환각을 보았습니다. 마지막 MHA 만화 챕터에 대해 물었을 때(다행히 MHA가 My Hero Academia라는 걸 알고 있었습니다) 382챕터라고 했는데, 틀린 내용이었습니다. 인터넷에서 다시 확인해 달라고 요청했더니 정답이 나왔습니다.
우리는 Moyens I/O에서 정기적으로 Minecraft를 다루므로 Gemini가 Minecraft에 대해 무엇을 알고 있는지 궁금했습니다. 먼저 물었습니다. “마지막 마인크래프트 업데이트는 무엇이었나요?” 이에 대해 Gemini Live는 2024년 6월에 출시되는 The Wild 업데이트로 응답했습니다. 시대에 발맞추는 건 이 정도였습니다. 그런 다음 AI에게 버전 번호를 물었고, AI는 올바르게 응답했습니다.
하지만 답변의 마지막에 나를 당황하게 하는 것이 하나 추가되었습니다. 지금 최신 버전은 1.20이라고 했습니다(뭐라고요!? 제미니, 방금 마지막 큰 Minecraft 업데이트가 1.19라고 말했잖아요). 그런 다음 Minecraft 1.20에 대해 조금 더 물었습니다. 출시일은 쌍둥이자리가 나에게 전달한 것도 또 틀렸어! 기능 세부 정보는 괜찮았지만 날짜는 대체로 부정확했습니다.
아직 끝나지 않았습니다. 저는 Minecraft 1.21 업데이트가 최근 6월에 나왔다는 것을 알고 있었기 때문에 Gemini에게 그것에 대해 물었습니다. 이에 대해 저는 더욱 당황스러운 답변을 받았습니다. Gemini에 따르면 Minecraft 1.21은 아직 나오지 않았습니다. 이것은 저를 빠르게 Gemini에게 지식 한계에 대해 물어보니 2024년 9월이라고 답했습니다.. 하지만 제미니는 인터넷에 접속할 수 있지 않나요? 제 질문을 구글링할 수 없나요? 뭐가 잘못되었는지는 잘 모르겠지만, 정답을 얻으려면 조수에게 인터넷에서 다시 확인해 달라고 부탁해야 했습니다.
롤플레잉
롤플레잉을 테스트하기 위해 Gemini Live에 다음을 요청했습니다. 영국 집사처럼 행동하다. 처음에는 세련되고 공식적인 어조로 말하며 ‘선생님’이라고 불렀지만, 금세 자신의 역할을 잊어버렸습니다. 계속해서 본래의 자신으로 돌아갔습니다. 나는 그 역할을 잊지 말라고 여러 번 일깨워야만 했습니다. 말할 것도 없이, 아직 악센트를 표현할 수 없어…그래서 결국 그 사람은 영국 집사가 아니었던 거군요.
Gemini는 이전 테스트에서 지시를 따르는 데 있어 성과가 좋지 않았고, Gemini Live도 마찬가지입니다. 같은 채팅 세션에서 다른 주제로 이동하면 역할과 맥락을 쉽게 잊어버립니다.
정보 찾기
저는 Gemini Live에 콜카타에서 가장 맛있는 비리아니를 먹을 수 있는 레스토랑을 찾아달라고 부탁했습니다. 그리고 그들은 비리아니의 인기 있는 매장인 Arsalan이나 Karim’s를 고려해보라고 했습니다. 저는 또한 Gemini Live에 노트북을 수리할 수 있는 매장을 찾아달라고 부탁했고, 그들은 몇 개의 합법적인 이름으로 응답했습니다. 정보를 찾는 데 있어서 Gemini Live는 충분히 잘 해냈습니다.
Gemini Live vs ChatGPT 고급 음성 모드
Cristiano Giardina의 ChatGPT 고급 음성 모드에서 영감을 얻음 데모나는 Gemini Live에 요청했습니다 1에서 10까지 세는 것은 매우 빠르다하지만 음성을 텍스트로 변환하는 기능 덕분에 표준 속도로 계속 계산이 이루어졌습니다.
예시 X 게시물에서는 ChatGPT 음성 모드가 반면, 사람처럼 숨을 쉬려고 멈췄다 세는 동안! 네이티브로 음성을 입력하고 출력할 때 얻을 수 있는 진정한 멀티모달 경험입니다.
또한 Gemini Live는 중간에 멈추지 않고도 혀꼬이는 말을 반복할 수 없는데, 이는 ChatGPT의 고급 음성 모드에서 가능한 일입니다. 기적적으로 잘. 그 후에 저는 Gemini Live에 David Attenborough의 악센트로 말하도록 요청했지만, 위에서 언급했듯이 아직은 악센트를 표현할 수 없습니다.
결론적으로 Gemini Live는 캐주얼한 대화에는 좋지만 전혀 획기적이지 않다Gemini Live에서 ChatGPT의 고급 음성 모드와 완벽하게 일치하려면 Google이 기본 입출력 기능을 잠금 해제할 때까지 기다려야 합니다.
안녕 구글, 제미니 라이브에서 감정은 어디에 있나요?
Gemini가 2024년 12월에 출시되었을 때, Google은 Gemini가 진정한 네이티브 멀티모달 모델이라고 발표했습니다. 오디오 처리의 경우, Gemini는 음성의 톤과 음조를 식별하고, 발음을 인식하고, 원시 오디오 신호를 네이티브로 처리하여 행복, 슬픔, 흥분 등 사람의 기분을 감지할 수 있다는 것을 의미합니다.
네이티브 입력 및 출력 방식에서 원시 음성은 토큰화되고 멀티모달 모델에 의해 직접 처리됩니다. 음성이 텍스트로 변환되는 중간 계층을 거치지 않습니다. 음성-텍스트(STT) 엔진음성의 모든 뉘앙스를 잃습니다. 텍스트 출력은 언어 모델을 사용하여 추가로 생성되고, 마지막으로 출력은 텍스트 음성 변환(TTS) 엔진을 통해 전달됩니다.
이러한 전통적인 접근 방식은 음성의 억양, 표현, 분위기 등을 이해하는 것과 같은 기본적인 엔드투엔드 멀티모달 기능을 활용하지 못합니다. 게다가 지연 시간이 길어지고 대화가 자연스럽기보다는 로봇처럼 느껴집니다.
Gemini Live를 통해 Google이 ChatGPT의 Advanced Voice Mode와 같은 네이티브 입력/출력 멀티모달 경험을 제공할 것으로 기대했습니다. 그러나 Gemini Live가 여전히 오디오를 처리하는 데 기존 방식을 사용하고 있다는 것은 매우 분명합니다.
이를 증명하기 위해, 저는 제미니 라이브에 동물의 소리를 식별해 달라고 요청했고, 제미니 라이브는 아직 소리를 처리할 수 없다고 응답했습니다. 그 다음, 제미니 라이브는 제 생말을 처리하여 제가 행복한지 슬픈지 식별할 수 없었습니다.
궁극적으로, 제 경험을 요약하자면, Gemini Live의 현재 구현은 진정한 자연스러운 대화를 제공할 수 있는 장비가 없습니다. 이 시점에서, Gemini Live는 단순히 화려한 TTS 엔진처럼 느껴집니다. LLM으로 지원됩니다. Gemini 1.5 Flash로 구동되어 빠른 응답을 생성한 다음 TTS/STT 엔진을 사용하여 오디오를 처리합니다. 적어도 약간 실망스러운 경험이었습니다.
Gemini Live에 접속하셨나요? Gemini와의 대화는 어땠나요? 댓글 섹션에서 저희와 독자들에게 경험을 공유해 주세요.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.






















