ChatGPT vs Gemini: 원시 이미지 생성 기능 테스트.

ChatGPT vs Gemini: 원시 이미지 생성 기능 테스트.

Google과 OpenAi는 최고의 기본 이미지 생성 모델을 제공하기 위해 경쟁하고 있습니다. Google이 Gemini에서 기본 이미지 생성을 도입 한 후 Openai는 시간을 낭비하지 않았으며 기본 이미지 출력에 대한 지원이 추가되었습니다 모든 chatgpt 사용자를 위해. 따라서 어떤 AI 모델이 더 나은 결과를 제공하는지 알아 내기 위해 OpenAi의 ChatGpt 및 Google Gemini에서 기본 이미지 생성을 비교했습니다. 이 게시물에서 문자 일관성, 텍스트 렌더링, 지시 준수 등 모델을 테스트했습니다.

1. 자신을 애니메이션 캐릭터로 바꾸십시오

나는 애니메이션 스타일 이미지를 만들기 위해 두 모델 모두를 제기함으로써 Chatgpt와 Gemini 간의 기본 이미지 생성 비교를 시작했습니다. 아래 결과에서 볼 수 있듯이 Chatgpt 4o는 공원에서 닿아 클래식 스튜디오 Ghibli 스타일의 이미지를 한 번에 생성했습니다. 다른 한편으로, 나는 Gemini에서 여러 가지 프롬프트를 시도했지만 기본 이미지 생성 모델은 애니메이션 스타일 이미지를 전혀 만들 수 없었습니다.

2. 화이트 보드 세션

다음 테스트에서 나는 Chatgpt와 Gemini에게 이미지를 보여주는 이미지를 만들도록 요청했습니다. 상대성의 개념을 설명하는 사람. 더 큰 ChatGpt 4O 모델 덕분에 Chatgpt는 19 개의 필기 텍스트가있는 훌륭한 이미지를 만들었습니다. 심지어 사진 작가를 반성했습니다.

그러나 더 작은 Gemini 2.0 플래시 모델 텍스트를 받기 위해 고군분투했습니다 화이트 보드에 바로. Gemini는 남자의 티셔츠에 “Moyens I/O”를 성공적으로 추가했지만 사진 작가의 반사를 포착하지 못했습니다. 즉, Gemini의 출력에있는 사람은 Chatgpt의 출력에 비해 더욱 정통 해 보입니다.

3. 메뉴 카드의 텍스트 렌더링

이것은 기본 이미지 생성에서 Chatgpt와 Gemini의 차이점을 보여주는 가장 좋은 예입니다. Chatgpt는 완벽한 텍스트 렌더링으로 아름다운 메뉴 카드를 디자인했습니다. 마지막 요리에서는 놓쳤지만 내 지시를 잘 따랐습니다. 즉, 쌍둥이 자리는 환각을 시작합니다 프롬프트에 조밀 한 정보를 던지면. 뒤죽박죽으로 거의 모든 텍스트가 잘못되었습니다.

4. 인포 그래픽을 만듭니다

그 후, 나는 chatgpt와 gemini에게 물었다 인포 그래픽을 만듭니다 중력의 개념을 설명하고, 뉴턴을 캐릭터로 특징 지었다. Chatgpt가 디자인과 명확하고 읽을 수있는 텍스트로 개념을 설명하는 측면에서 화려한 작업을 수행했다는 것은 말할 것도 없습니다.

결과는 너무 좋아서 Chatgpt의 기본 이미지 생성 기능이 사용될 수 있습니다. 만화 스트립, 교육 서적, 시각적 가이드 등을 만듭니다.

또한 읽기 :

Gemini의 기본 Image Gen 기능은 워터 마크 제거 이상으로 갈 수 있습니다.

반면에, Gemini는 그 결과에 실망했습니다. 텍스트와 영상은 의미가 없습니다. 주목해야 할 것은 Gemini 2.0 Flash가 이미지를 생성한다는 것입니다. 3 ~ 4 초 안에Chatgpt는 단일 이미지를 생성하는 데 1 분 이상 걸립니다. ChatGpt는 많은 처리 능력을 사용하는 더 큰 4O 모델을 사용하여 훨씬 더 일관된 결과를 초래합니다.

5. 리스트레 이미지

이미지의 재조정에오고, i 선인장 식물의 이미지를 업로드했습니다 정원에서, 두 모델 모두 화려한 꽃을 추가하도록 자극했습니다. 내 테스트에서 나는 Chatgpt가 각 개선 할 때마다 배 밖으로 나가는 것을 발견했습니다. 각 수정 후 이미지의 모양을 완전히 변경했습니다. 대조적으로, Gemini 모델은 여러 세대의 일관성을 유지했습니다.

Chatgpt 4o는 기본적으로 멀티 모달 (자동 요정 아키텍처에 구축)이지만 일부는 전문가 기본 이미지 생성 기능은 확산 기반 디코더를 사용한다고 믿습니다. 텍스트를 정확하게 렌더링하는 데 도움이되지만 각 반복의 이미지를 재생합니다.

그래서 순수한 자동 중심 모델이 아닙니다 Gemini 2.0 플래시와 마찬가지로 각 수정 후 이미지 출력의 차이입니다.

6. 이미지를 함께 혼합하십시오

다음으로, 나는 두 개의 이미지를 업로드하고 chatgpt와 gemini에게 머그잔을 들고있는 여자의 이미지를 만들도록 요청했습니다. 두 모델 모두 인상적인 결과를 제공했습니다. 사실, Gemini는 조금 더 창의적이었고 자세를 바꿨습니다. 즉, OpenAi는 ChatGpt 4O가 최대 20 개의 이미지를 하나의 프롬프트로 처리 할 수 ​​있으며 단일 통합 이미지를 생성하기 위해 텍스트 내 학습을 활용할 수 있다고 말합니다.

7. 관점을 바꾸십시오

다음 테스트에서 나는 복도의 이미지를 업로드하고 Chatgpt와 Gemini에게 관점을 바꾸도록 촉구했습니다. 두 모델 모두 거의 비슷한 결과를 제공했지만 Chatgpt는 원본 이미지에 더 가깝습니다. 쌍둥이 자리는 환각을 느끼고 안락 의자에 다리를 추가했습니다. 전반적으로, 나는이 라운드를 Chatgpt에게 줄 것입니다.

8. 6:30 시간을 보여주는 벽 시계

마지막으로, 마지막 테스트에서 Chatgpt와 Gemini는 모두 벽 시계에서 지정된 시간 (6:30)을 올바르게 렌더링하지 못했습니다. AI 이미지 생성에서 반복되는 문제입니다. 모델은 편견으로 인해 기본값 10:10 교육 데이터 세트에서. 따라서 기본 이미지 생성에도 OpenAi와 Google은 다음과 같은 지시 에서이 제약을 극복 할 수 없었습니다.

결론 : chatgpt vs gemini 기본 이미지 생성

다양한 테스트를 실행 한 후에는 자신있게 말할 수 있습니다. Chatgpt의 기본 이미지 생성은 현재 더 발전하고 있습니다 Gemini 2.0 플래시보다. 그것은 더 넓은 세계 지식을 가진 더 큰 Chatgpt 4O 모델로 구동됩니다. 이로 인해 더 일관된 이미지가 발생합니다. 텍스트를 완벽하게 렌더링하고 인상적인 정밀도로 지침을 따릅니다.

대조적으로 Google 실험 Gemini 2.0 플래시 모델은 더 작습니다이는 성능이 빨라집니다. 그러나 짙은 텍스트를 렌더링하면서 종종 환각을 느끼며 결과는 품질이 낮습니다.

Gemini가 눈에 띄게 만드는 것은 각 세대 후 일관성을 유지한다는 것입니다. 이는 큰 이점입니다. 새로 출시 된 Gemini 2.5 Pro 모델에서 기본 이미지 출력 지원을 기다려야하며, 이는 기본 이미지 생성에서 탁월한 성능을 제공 할 것으로 예상됩니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  정부, 구글 엑스에이 마이크로소프트 AI 심사 계약 페이지 삭제
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.