Anthropic은 최근 최신 Claude 3.5 Sonnet 모델을 출시했고 여러 벤치마크에서 ChatGPT 4o와 Gemini 1.5 Pro를 이긴다고 주장했습니다. 따라서 이 주장을 테스트하기 위해 이 자세한 비교를 내놓았습니다. Claude 3 Opus, GPT-4, Gemini 1.5 Pro 간의 이전 비교와 마찬가지로 추론 기능, 멀티모달 추론, 코드 생성 등을 평가했습니다. 이에 대해 시작해 보겠습니다.
1. 건조 시간 찾기
기본적인 질문처럼 보이지만, 저는 항상 이 까다로운 추론 문제로 시험을 시작합니다. LLM은 종종 틀리는 경향이 있습니다. Claude 3.5 Sonnet도 같은 실수를 했고 수학을 사용하여 문제에 접근했습니다. 이 모델은 20개의 수건을 말리는 데 1시간 20분이 걸린다고 말하는데 이는 틀렸습니다. ChatGPT 40과 Gemini 1.5 Pro는 정답을 얻었고, 20개의 수건을 말리는 데 여전히 1시간이 걸린다고 말했습니다.
햇빛 아래에서 수건 15개를 말리는 데 1시간이 걸린다면, 수건 20개를 말리는 데는 얼마나 걸릴까요?
우승자: ChatGPT 4o 및 Gemini 1.5 Pro
2. 무게 평가
다음으로, 이 고전적인 추론 문제에서, Claude 3.5 Sonnet, ChatGPT 4o, Gemini 1.5 Pro를 포함한 세 모델 모두 정답을 맞혔다는 것을 보고하게 되어 기쁩니다. 깃털이나 그 무엇이든 1kg은 항상 강철이나 다른 재료 1파운드보다 무거울 것입니다.
1kg의 깃털과 1파운드의 강철 중 무엇이 더 무거운가요?
우승자: Claude 3.5 Sonnet, ChatGPT 4o 및 Gemini 1.5 Pro

3. 단어 퍼즐
다음 추론 테스트에서 Claude 3.5 Sonnet은 David에게 형제가 없고, 형제 중에서 유일한 형제라고 올바르게 답했습니다. ChatGPT 4o와 Gemini 1.5 Pro도 정답을 맞혔습니다.
데이비드는 세 자매가 있습니다. 그들 각자는 한 명의 형제가 있습니다. 데이비드는 몇 명의 형제가 있습니까?
우승자: Claude 3.5 Sonnet, ChatGPT 4o 및 Gemini 1.5 Pro

4. 아이템 정리하기
그 후, 저는 세 모델 모두에게 이 아이템들을 안정적으로 배열하라고 했습니다. 아쉽게도 세 모델 모두 틀렸습니다. 모델들은 동일한 접근 방식을 취했습니다. 먼저 노트북을 놓고, 그 다음 책을 놓고, 그 다음 병을 놓고, 그 다음 병 바닥에 계란 9개를 놓았는데, 이는 불가능합니다. 참고로, 이전 GPT-4 모델이 정답을 맞혔습니다.
여기 책 한 권, 계란 9개, 노트북 한 개, 병 한 개, 못 한 개가 있습니다. 이것들을 안정적으로 쌓는 방법을 알려주세요.
우승자: 없음

5. 사용자 지침을 따르세요
그것의 블로그 게시물Anthropic은 Claude 3.5 Sonnet이 지시를 따르는 데 뛰어나다고 언급했고, 사실인 듯합니다. 그것은 “AI”라는 단어로 끝나는 10개의 문장을 모두 생성했습니다. ChatGPT 4o도 10/10점을 받았습니다. 그러나 Gemini 1.5 Pro는 10개 중 5개의 문장만 생성할 수 있었습니다. Google은 더 나은 지시 따르기를 위해 모델을 조정해야 합니다.
“AI”로 끝나는 문장 10개를 생성하세요
우승자: 클로드 3.5 소네트와 ChatGPT 4o

6. 바늘을 찾아라
Anthropic은 100K 토큰에서 시작하여 현재 200K 컨텍스트 윈도우까지 큰 컨텍스트 길이를 제공한 최초의 회사 중 하나였습니다. 따라서 이 테스트를 위해 25K 문자와 약 6K 토큰이 있는 큰 텍스트를 입력했습니다. 중간 어딘가에 바늘을 추가했습니다.
저는 세 모델 모두에 바늘에 대해 물었지만, 클로드 3.5 소넷만이 제자리에 없는 문장을 찾을 수 있었습니다. ChatGPT 4o와 제미니 1.5 프로는 바늘을 찾을 수 없었습니다. 그래서 큰 문서를 처리하기 위해서는 클로드 3.5 소넷이 더 나은 모델이라고 생각합니다.
우승자: 클로드 3.5 소네트

7. 시력 검사
시각 기능을 테스트하기 위해, 읽을 수 없는 필기 이미지를 업로드하여 모델이 문자를 얼마나 잘 감지하고 추출하는지 확인했습니다. 놀랍게도, 세 모델 모두 훌륭한 성과를 거두었고 텍스트를 올바르게 식별했습니다. OCR과 관련하여 세 모델 모두 매우 유능합니다.
우승자: Claude 3.5 Sonnet, ChatGPT 4o 및 Gemini 1.5 Pro

8. 게임 만들기
마지막으로 마지막 라운드에 왔습니다. 이 테스트에서 저는 이름을 밝히지 않고 고전적인 테트리스 게임의 이미지를 업로드하고 모델에게 파이썬으로 이와 같은 게임을 만들라고 요청했습니다. 글쎄요, 세 모델 모두 게임을 정확하게 추측했지만 Sonnet이 생성한 코드만 성공적으로 실행되었습니다. ChatGPT 4o와 Gemini 1.5 Pro는 모두 버그 없는 코드를 생성하지 못했습니다.

한 번에, 게임은 Sonnet의 코드를 사용하여 성공적으로 실행되었습니다. 저는 pygame 라이브러리를 설치하기만 하면 되었습니다. 많은 프로그래머가 코딩 지원을 위해 ChatGPT 4o를 사용하지만, Anthropic의 모델이 코더들 사이에서 새로운 인기를 얻을 것으로 보입니다.
클로드 3.5 소넷은 코딩 능력을 평가하는 HumanEval 벤치마크에서 92%를 기록했습니다. 이 벤치마크에서 GPT-4o는 90.2%, Gemini 1.5 Pro는 84.1%를 기록했습니다. 코딩의 경우, 이 도시에는 새로운 SOTA 모델이 있으며, 바로 클로드 3.5 소넷 모델입니다.
우승자: 클로드 3.5 소네트
결론
세 가지 모델 모두에서 다양한 테스트를 실행한 후, Claude 3.5 Sonnet이 ChatGPT 4o 모델만큼 좋거나 더 좋다고 느꼈습니다. 특히 코딩에서 Anthropic의 새로운 모델은 정말 인상적입니다. 놀라운 점은 최신 Sonnet 모델이 아직 Anthropic의 가장 큰 모델도 아니라는 것입니다.
이 회사는 올해 말에 Claude 3.5 Opus가 출시될 예정이며, 더 나은 성능을 보일 것이라고 말합니다. Google의 Gemini 1.5 Pro도 이전 테스트보다 더 나은 성능을 보였는데, 이는 상당히 개선되었다는 것을 의미합니다. 전반적으로 OpenAI가 LLM 분야에서 훌륭한 성과를 내는 유일한 AI 랩은 아니라고 말하고 싶습니다. Anthropic의 Claude 3.5 Sonnet이 그 사실을 증명합니다.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.






















