젬니 1.5 프로: 오디오 청취 중 - 모든 사용자에게 제공 가능

젬니 1.5 프로: 오디오 청취 중 – 모든 사용자에게 제공 가능

라스베이거스에서 열린 Google Cloud Next 2024 이벤트에서 Google은 Gemini 1.5 Pro를 모든 사용자에게 일반적으로 제공할 것이라고 발표했습니다. 많은 기대를 모았던 이 모델이 마침내 100만 컨텍스트 윈도우와 함께 공개 미리보기로 공개되었으며, 더 이상 가입할 필요가 없습니다 Gemini 1.5 Pro 모델에 대한 대기자 명단에 오르려면

저는 새로운 Google 계정에서 Gemini 1.5 Pro 모델에 액세스하려고 했고, 모델은 대기 없이 바로 사용할 수 있었습니다. 그리고 이 모든 것이 무료로 제공됩니다.

그렇다고 해서 Gemini 포털에서 Gemini 1.5 Pro 모델을 사용할 수 있다는 의미는 아닙니다. 다음으로 이동해야 합니다. aistudio.google.com (방문하다) 현재 모델에 액세스하려면. 몇 달 동안 공개 미리보기를 거친 후, 모델은 Gemini 포털에서 사용할 수 있게 됩니다. 모델을 사용하려면 Gemini Advanced 구독이 필요할 가능성이 큽니다.

Gemini 1.5 Pro 모델은 중간 모델 그러나 MoE 아키텍처를 기반으로 구축되었지만 가장 큰 Gemini 1.0 Ultra 모델을 쉽게 이깁니다. 그리고 GPT-4 모델과의 비교에서 Gemini 1.5 Pro는 여러 테스트에서 놀라운 성능을 보였습니다. Gemini 1.5 Pro가 Gemini 포털에 데뷔하면 GPT-4와 Claude 3의 Opus 모델보다 더 나은 성능을 보일 것으로 기대됩니다.

그 외에도 Gemini 1.5 Pro는 이제 오디오 파일도 처리해. 회의나 비디오의 오디오 파일을 업로드할 수 있으며, 모델은 수동으로 대본을 생성할 필요 없이 업로드된 파일을 들을 수 있습니다. 오디오 회의나 토론에서 빠르고 체계적인 정보를 찾고자 하는 사람들에게 큰 도움이 될 수 있습니다.

제미니 1.5 프로 이미 비디오를 처리할 수 있습니다 그리고 이미지, 그리고 이제 오디오 파일도 지원되어 100만 토큰의 컨텍스트 길이를 가진 강력한 멀티모달 모델이 되었습니다. Gemini 1.5 Pro 모델의 오디오 처리 기능을 테스트했습니다. 다음은 그 결과입니다.

Gemini 1.5 Pro에서 오디오 파일을 처리하는 방법

  • 로 이동 aistudio.google.com (방문하다)을 브라우저에서 실행합니다.
  • 다음으로, “제미니 1.5 프로드롭다운 메뉴에서 ” 모델이 선택되었습니다.
제미니 1.5 프로 모델을 선택하세요
  • 그 후, “오디오상단 행의 ” 메뉴를 클릭하고 오디오 파일을 업로드하세요. 다음 오디오 파일 형식을 지원합니다: FLAC, MIDI, MP3, M4A, OPUS, OGG, OGA, WAV 및 MID.
Google AI Studio에 오디오 파일 업로드
  • 오디오 파일을 처리하고 소비합니다. 토큰.
  • 지금, 질문을 시작하세요그리고 Gemini 1.5 Pro는 오디오에서 정보를 찾아 그에 따라 반응합니다.
제미니 1.5 프로 오디오 파일 처리
  • 가장 좋은 점은 그것이 생성된다는 것입니다 성적 증명서 구조화된 형식으로, 다른 화자의 라벨이 붙어 있습니다. 그리고 전혀 환각을 보이지 않습니다.
제미니 1.5 프로 오디오 대본 생성

Gemini 1.5 Pro에서 오디오 파일을 업로드하고 처리하는 방법입니다. Google DeepMind 팀의 정말 강력한 모델이고, 이제 일반 대중이 아무런 비용 없이 사용할 수 있게 되어 기쁩니다. 계속해서 시도해 보시고 아래의 댓글 섹션에 생각을 알려주세요.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  중앙은행장 회의, AI 거품 경고음 울려
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.