쌍둥이자리의 새로운 네이티브 이미지 생성 기능: 내 경험

쌍둥이자리의 새로운 네이티브 이미지 생성 기능: 내 경험

우리는 용어를 듣고 있습니다.기본적으로 다중 모드‘AI 공간에서 1 년 넘게 회사는 AI 모델의 전체 멀티 모달 기능을 잠금 해제하는 데 속도가 느 렸습니다. Google은 최신 “Gemini 2.0 Flash Experimental”모델을 다음과 함께 출시했습니다. 이미지를 생성하고 편집하는 기능 기본적으로.

이제 이미지 생성과의 큰 문제는 무엇입니까? AI 이미지 생성은 Chatgpt와 같은 모든 주요 AI 챗봇에서 꽤 오랫동안 사용할 수 있습니다. chatgpt 또는 gemini에서 AI 이미지를 생성 할 때 프롬프트는 Dall-E 3 또는 Imagen 3과 같은 특수 확산 기반 모델로 라우팅됩니다. 상기 모델은 이미지에 대해 교육을 받고 이미지를 생성하도록 설계되었습니다. 그것들은 메인 AI 모델의 확장과 같으며 그 일부는 아닙니다.

그러나 Gemini와 같은 언어 vision 모델은 기본적으로 멀티 모드이므로 본질적으로 텍스트와 이미지를 이해, 생성 및 수정할 수 있습니다. 지금까지 기술 회사는 사용자 가이 기능을 사용할 수 없었습니다. OpenAi는 2025 년 GPT-4O와 함께 기본 이미지 생성 기능을 시연했지만 다시는 출시되지 않았습니다.

기본 이미지 생성을 통해 얻을 수 있습니다 더 나은 일관성 멀티 모달 모델은 다양한 양식의 대규모 데이터 세트에서 훈련됩니다. 결과적으로 이러한 모델은 개념에 대한 이해를 높이고 더 넓은 세계 지식을 보여줍니다.

또한 읽기 :

지금 Photoshop의 AI 생성 채우기 도구를 사용하는 방법

이미지 생성 외에도 간단한 프롬프트로 이미지를 원활하게 편집 할 수 있습니다. 예를 들어, 이미지를 업로드하고 모델에 선글라스를 추가하고, 읽기 쉬운 텍스트를 삽입하고, 객체를 제거하는 등 이미지에 대한 모델을 요청할 수 있습니다. 각각의 새로운 프롬프트와 함께 전체 이미지를 재생하는 확산 모델과 달리, 기본적으로 멀티 모달 모델은 다중 수정에서 일관성을 유지합니다.

Gemini 2.0 플래시 실험으로 기본 이미지 생성

현재 일반 사용자는 기본 이미지 생성 기능을 사용할 수 없습니다. 기본 이미지 생성이있는 Gemini 2.0 플래시 실험 모델은 Google의 AI Studio에서만 사용할 수 있습니다.방문하다) 무료.

AI Studio의 모델을 미리 보면 Gemini에서 모든 사람들이 가까운 시일 내에 사용할 수 있도록 출시 될 예정입니다. 그러나 나는 기본 이미지 생성을 가진 새로운 Gemini 모델을 시험해 보았고, 그것은 매우 흥미로운 경험이었습니다.

먼저 Gemini의 기본 이미지 생성 기능의 일관성을 보여주는 시각적 가이드로 시작했습니다. 나는 Gemini에게 오믈렛을 만드는 방법에 대한 시각적 가이드를 만들어 프로세스의 각 단계마다 이미지를 생성하도록 요청했습니다.

  • 쌍둥이 자리를 사용하여 오믈렛을 만드는 시각적 가이드 2
  • 시각 가이드 3 쌍둥이 자리를 사용하여 오믈렛을 만듭니다
  • 시각 가이드 4 쌍둥이 자리를 사용하여 오믈렛을 만듭니다

알 수 있듯이 결과는 결함이없는 이미지에서 매우 일관성이 있습니다. 그릇조차도 두 번째 이미지에서 동일합니다. 마지막으로 이미지를 1024 x 680 해상도로 다운로드 할 수 있습니다. 이렇게하면 원하는 것에 대한 시각적 가이드를 만들 수 있습니다.

다음으로, 나는 Gemini에게 미적 테이블을 만들도록 요청한 다음 중앙 카메라 각도에서 테이블을 보여달라고 말했습니다. 완벽한 일을했습니다. 그 후, 나는 Gemini에게 테이블에 PlayStation을 추가하고 자세히 살펴 보라고한다. 다시, 쌍둥이 자리가 못 박았습니다. 아래에서 볼 수 있듯이 AI 모델에는 뒤의 거울에 PS5의 반사가 포함되었습니다.

  • Gemini Native를 사용하여 테이블 이미지 생성
  • Gemini Native를 사용하여 테이블의 이미지 2를 만듭니다

Gemini 2.0 플래시 실험으로 기본 이미지 편집

기본 이미지 편집을 보여주기 위해 갤러리에서 이미지를 업로드하고 Gemini 2.0에게 테이블에서 와인 잔을 제거하도록 요청했습니다. 그 후, 나는 Gemini에게 피자에 버섯을 추가하라고 말했다. 그런 다음 Gemini에게 크루아상을 추가하라는 gemini를 촉구했으며 Gemini의 기본 멀티 모드 기능 덕분에 AI 이미지 편집이 완전한 영광으로 편집되었습니다.

  • Gemini를 사용한 피자 이미지 편집
  • Gemini를 사용한 피자 2 이미지 편집

다음으로, 나는 내 이미지를 업로드하고 Gemini에게 선글라스를 추가 한 다음 티셔츠에 “Moyens I/O”텍스트를 추가하도록 요청했습니다. 둘 다 꽤 잘 이루어졌습니다.

  • Gemini를 사용한 이미지 편집
  • Gemini를 사용하여 다른 이미지 편집

마지막으로, 나는 Gemini에게 이미지를 채색하도록 요청했고, 그것은 정말로 잘 작동했습니다. 내 말은, 이미지는 이상한 결함, 아티팩트 또는 이미지의 일부없이 이전보다 더 아름답게 나왔습니다.

Gemini를 사용하여 이미지를 색칠하십시오

Gemini의 새로운 멀티 모드 기능으로 시도 할 수있는 많은 사용 사례가 있습니다. Google은 기본 이미지 생성 및 편집으로 훌륭한 작업을 수행했으며 앞으로 몇 주 안에 한도를 테스트하기 위해 더 엄격하게 사용할 계획입니다.

비디오 생성을위한 VEO 2가 릴리스되고 특수 이미지 생성을위한 Imagen 3을 출시 한 후 Google은 많은 영역에서 OpenAI를 분류 한 것으로 보입니다. AI 텍스트 생성만이 아닙니다. 따라서 Openai가 Chatgpt의 최고점을 되 찾는 것과 함께 무엇을하는지 보는 것은 흥미로울 것입니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  보도: 스페이스X AI와 커서, 이번 주 주요 AI 모델 출시