AI 하드웨어 대 온디바이스 AI: 우수한 성능을 위한 싸움

AI 하드웨어 대 온디바이스 AI: 우수한 성능을 위한 싸움

Google I/O 2024를 앞두고 Google이 AI에 대해 이야기할 것이라는 데는 의심의 여지가 거의 없었습니다. 이 행사는 적절하게 시끄러운 분위기로 시작되었습니다. YouTube의 센세이션인 Marc Rebillet은 거대한 컵에서 튀어나온 후 목욕 가운을 입고 쇼를 시작했습니다.

소셜 미디어 스타는 청중들에게 Google의 AI DJ 소프트웨어를 통해 실현된 거친 음악 아이디어를 요청하여 나머지 이벤트의 분위기를 조성했습니다. 진행자는 더 나은 시작을 기대할 수 없었습니다. CEO Sundar Pichai의 말에 따르면 Google 임원들은 “AI”라는 단어를 121번이나 말했습니다.

행사가 끝날 무렵, 저는 두 가지 괴로운 의문을 품게 되었습니다. 첫째: 구글은 평범한 사람의 삶에 존재하지도 않는 문제를 제미니 젤라토를 강제로 먹임으로써 해결하려고 하는 것일까요? 둘째: 휴대전화의 AI가 정신을 뒤흔드는 일련의 초능력을 얻고 있을 때, 몇 백 달러짜리 전문 AI 하드웨어에 대한 시장이 있을까요?

AI 장신구의 상태

벤치에 쉬고 있는 Rabbit R1.
조 마링 / 모옌스 I/O

지금까지 Rabbit R1과 같은 귀여운 오렌지색 AI 가젯과 Humane AI Pin만큼 훌륭한 것이 있습니다. 한 브랜드는 AI 펜던트를 만들고 있습니다. 일부는 듣기만 합니다. 다른 일부는 말하고, 비디오를 녹화하고, 전화를 걸고, 수다스러운 AI 봇을 활용하고, 심지어 주변 세계를 이해하려고 시도합니다.

이제, 지금까지 이 기기들이 얼마나 형편없었는지에 대해서는 논의하지 않을 것입니다. 하지만 Moyens I/O 모바일 섹션 편집자 Joe Maring은 Rabbit R1이 그가 사용해 본 최악의 기기 중 하나라고 말합니다. Humane AI Pin의 이야기도 크게 다르지 않았습니다. 아야! 좋아요, 이것들은 모두 이런 종류의 1세대 기기이므로, 좀 봐주도록 하죠.

하지만 현실은 이렇습니다. 그들의 미래는 밝지 않고, 주머니에 부담이 되지 않으며, 편리하지도 않습니다. 이틀 만에 두 AI 거물인 OpenAI와 Google이 그 요점을 거의 확실하게 밝혔습니다.

AI는 이제 세상을 인식합니다

ChatGPT 앱에서 AI의 비전 기능 사용.
오픈AI

비전부터 시작해 보겠습니다. 비전은 AI가 카메라 렌즈를 통해 세상을 보고, AI가 보는 것에 대해 이야기할 수 있게 해주는 힘입니다. Google은 I/O 2024에서 Gemini Live라는 것을 선보였습니다. 그보다 하루 전, OpenAI는 GPT-4o를 공개했습니다. 여기서 “o”는 옴니모달을 의미합니다. 이는 멀티모달을 멋지게 표현한 것으로, AI 친구가 입력 및 출력을 위해 텍스트, 오디오 및 비주얼을 처리할 수 있다는 의미입니다. 하지만 두 제품 모두 궁극적인 목표는 동일합니다.

원하는 AI를 실행하고, 카메라를 사실상 모든 곳에 겨누면 AI가 상황에 맞는 질문에 답합니다. 전면 카메라를 켜고 AI가 친구와 가위바위보를 하는 모습을 보면서 해설을 해달라고 요청할 수 있습니다. 분홍색 셔츠가 면접에 가장 적합한 옷이 아닌지 알아낼 수 있습니다.

필요할 때, 사물을 보고 포르투갈어로 설명하고, 믿음직한 투어 가이드처럼 건물을 식별하고, 테이블에 펼쳐진 색종이를 보고 특별한 행사를 감지할 수 있습니다. 코드를 가리키면 AI가 코드의 목적을 설명합니다. 그리고 AI가 어느 시점에서든 자동차 열쇠를 본 적이 있다면 정확히 어디에 두었는지 알려줍니다.

GPT-4o 비전 기능의 라이브 데모

이제, 앞서 언급한 모든 기능은 ChatGPT(GPT-4o 주스가 높음)와 Gemini Live(Google Astra 기술이 뒷받침됨)에서 균일하지 않습니다. 하지만 기본 사항은 공유됩니다. 이는 또한 휴대전화의 AI 경험과 전용 하드웨어의 AI 경험 간의 단절선이 넓어지는 중요한 시점이기도 합니다.

하드웨어 난제

ChatGPT 비전 기능이 실행 중인 모습입니다.
오픈AI

Rabbit R1과 Humane AI Pin은 각각 8메가픽셀과 12MP 카메라를 탑재했습니다. 그렇습니다. 그들은 세상을 보고 이해할 수 있지만, 반쯤 괜찮은 현세대 스마트폰의 광학적으로 안정화된 고해상도 카메라의 시각적인 솜씨에는 미치지 못합니다.

간단히 말해서, 일반적인 스마트폰은 로컬 또는 클라우드 기반의 AI 엔진에 더 건강한 시각적 데이터 포인트를 공급하여 더 나은 이해로 직접 전환됩니다. 저렴한 휴대전화와 플래그십 휴대전화에서 어려운 조명으로 촬영한 vlog를 비교하고 친구들에게 보이는 모든 것을 설명해 달라고 요청하는 것으로 생각해 보세요. 물론 흐릿하거나 터진 클립은 여기서 큰 도움이 되지 않습니다.

그리고 컴퓨팅 부분이 있습니다. 그중에서도 2024년 가장 화제가 된 AI 가젯은 중저가형 MediaTek과 Qualcomm 실리콘으로 구동됩니다. 이러한 기기는 전체 OS의 무게에 시달리지 않지만, 지금까지 본 바에 따르면, 괜찮은 스마트폰조차도 R1이나 Humane’s Pin에 비해 훨씬 빠른 속도로 AI 작업을 실행할 수 있습니다.

안드로이드 폰에서 AI 번역.
Google

저는 제 AI 가젯이 요청을 처리하는 데 15초가 걸리는 것을 원하지 않습니다. 오래된 Siri조차도 더 잘할 수 있을 때 말입니다. 그것은 형편없는 벤치마크이지만, R1이 서 있는 곳입니다. 이제 실리콘에 대해 이야기하고 있으니, 여기서 처리가 어떻게 중요한 역할을 하는지 논의해 보겠습니다. 생성적 AI 트릭은 두 가지 방식으로 실현됩니다. 대부분의 솔루션은 쿼리를 클라우드 서버로 전송하므로 인터넷 연결이 필요합니다.

두 번째 옵션은 오프라인 처리로, 구글의 제미니 나노 모델이 Pixel 8 시리즈와 삼성 폰 등에서 하는 방식입니다. 가장 큰 장점은 이 시나리오에서 인터넷 연결이 필요 없다는 것입니다. 현재 인터넷 연결 없이 작동할 수 있는 AI 사물은 없습니다.

온디바이스 AI는 진짜 보물이다

Google I/O 2024 기조연설에 참석한 순다르의 사진.
조 마링 / 모옌스 I/O

와 함께 기기에서 처리 중인 Pixel 휴대전화의 Recorder 앱은 오디오 녹음을 필사하고 요약할 수 있습니다. Magic Compose는 Wi-Fi나 셀룰러 연결을 요구하지 않고도 문자 메시지 게임을 한 단계 업그레이드합니다. 번역 및 필사에도 마찬가지입니다. 사실, Google은 신뢰할 수 있는 오프라인 번역의 기초를 1980년대부터 마련했습니다. 2018 인공신경망 기계 번역 기술을 사용하여

하지만 그것은 빙산의 일각일 뿐입니다. 올해 말, Google은 Gemini Nano with Multimodality를 출시할 예정입니다. 즉, Gemini Live가 휴대전화 카메라, 화면, 마이크를 통해 보고 듣는 것을 보고, 이해하고, 상황에 맞는 답변을 제공하기 위해 인터넷 연결이 필요하지 않다는 뜻입니다.

Google은 Gemini로 TalkBack 접근성 기능을 더욱 강화하고 있습니다. 이는 말하기와 가시성 문제가 있지만 멀티모달 기능을 갖춘 안정적인 TalkBack 동반자가 필요하지만 인터넷에 연결할 수 없는 사람들에게 큰 승리입니다.

Android에서 Gemini가 제공하는 TalkBack 기능.
Google

또한, 온디바이스 AI 처리가 더 빠르고, 데이터가 휴대폰에서 나가지 않기 때문에 훨씬 더 안전하다는 걸 말씀드렸나요? 더 중요한 것은, 궁극적으로 생성 AI 기능을 제공하는 비용을 낮춘다는 것입니다.

소비자 비용은 현재 AI 폰 마케팅 공세와 관련해 가장 큰 불확실성 중 하나입니다. 온디바이스 AI는 이 혼란 속에서 큰 안도감을 줍니다. 앞으로 몇 년 동안 기능 호환성에 대해 너무 걱정하지 않고도 폰이 할 수 있는 최소한의 기능에 대한 아이디어를 얻을 수 있기 때문입니다.

쌍둥이자리는 옳은 일을 하고 있어요

제미니 고급 문서 처리.
Google

마지막으로, 우리는 상호작용에 대한 너무나 중요한 질문을 가지고 있습니다. 제 삶은 Gmail, Docs, Drive, Maps, Photos, Search 등을 중심으로 돌아갑니다. Google은 Gems를 만들었는데, 이는 다른 생태계 제품과 긴밀하게 연결된 특정 작업을 처리하기 위한 맞춤형 Gemini 기반 어시스턴트입니다.

예를 들어, 제미니에게 여행 계획을 요청하면 제미니는 Gmail 받은편지함에서 티켓 일정을 확인한 다음, 음성/문자 메시지로 전달된 데이터를 관련 Google 검색 정보와 결합하여 더욱 구체적인 여행 계획을 세웁니다.

Gemini aAdvanced에 비용을 지불할 의향이 있는 사람들을 위해, 더 많은 생산성 슈퍼파워가 제공됩니다. 최대 1,500페이지의 PDF, 30,000줄의 코드, 1시간 분량의 비디오 또는 다양한 파일 형식의 혼합을 처리할 수 있습니다.

쌍둥이자리는 그 모든 입력을 처리한 다음 요약된 버전을 제공하고, 중요한 측면을 식별하고, 심지어 그 모든 자료를 섭취한 후 교사 역할을 할 수도 있습니다. 심지어 평범한 스프레드시트를 가져와 수익과 관련 통찰력을 명확하게 이해한 자세한 재무 보고서를 작성할 수도 있습니다.

AI는 심지어 전화를 듣고 발신자가 사기꾼인 경우 사용자에게 경고합니다. 사실, Gemini는 다른 앱으로 이동하지도 않습니다. 필요할 때 Gemini 인터페이스는 현재 사용 중인 앱 위에 마우스를 올려놓고 작업을 수행한 후 사라집니다.

스마트폰을 이기는 것은 어렵다

쌍둥이자리의 전화 경험.
Google

제가 여기서 말하고 싶은 요점은 AI가 조수 역할을 해야 하지만 기능적 다양성과 실용적인 편의성 사이에서 적절한 균형을 맞춰야 한다는 것입니다. 개인적으로나 직업적으로 저에게 중요한 데이터에 액세스할 수 있을 때만 가능합니다. 그리고 저는 모든 스마트함이 추가 재정적 부담 없이 가능한 최상의 방식으로 제공되기를 바랍니다.

지금 당장 Rabbit R1이나 Humane AI Pin 같은 제품은 그런 깊은 제품 상호 연결의 표면을 간신히 긁을 수 있을 뿐입니다. 게다가 하드웨어 자체가 AI가 최대한의 잠재력을 발휘하지 못하게 합니다. Google이 Rabbit R1 같은 것에 대해 Gemini Nano를 라이선스하는 것을 상상할 수 없고, 그렇게 되더라도 하드웨어 때문에 경험이 방해받을 것입니다.

그렇다면 주머니 속의 휴대전화가 엄청난 일을 해낼 수 있는데 왜 추가 비용을 지불하고 열등한 경험에 만족해야 할까요? AI 휴대전화가 등장했습니다. 그리고 그것은 영원히 남을 것입니다. 반면에 주황색과 반짝이는 AI 장신구는 죽은 것과 마찬가지입니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  베이비 비슈 AI 사진 프롬프트 2026: 제미니 & 픽스프리티 팁
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.