Elon Musk의 Xai는 이번 주에 가장 가까운 경쟁자로 신속하게 부상했습니다. 짧은 기간 동안 Xai는 Grok 3 모델을 개발하여 인상적인 벤치 마크 결과를 보여주었습니다. 그래서 우리는 깊은 다이빙을하고 Grok 3을 테스트했습니다. 기본 및 추론 모델 다양한 복잡한 프롬프트에서 우리가 발견 한 것은 정말 놀랍습니다.
Grok 3의 추론 쿼리
나는 인기있는 딸기 질문으로 Grok 3 추론 모델을 테스트하기 시작했고 딸기라는 단어에 3 개의 R이 있습니다 15 초 동안 생각한 후. 나는“Lollapalooza”라는 다른 단어를 던지고 L의 수를 세고 4로 대답하도록 요청했습니다.
다음으로 Grok 3에 더 큰 숫자 – 9.11 또는 9.9를 물었습니다. 다시, Grok 3은 8 초 동안 생각하고 정답을 생각해 냈습니다. 실제로 Grok 3 모델은 최종 결과를 확인하기 위해 여러 수학적 방법을 고안했습니다.
그 후, 나는이 약간 조정 된 퍼즐을 만들어 3을 Grok로 만들어 오도했다. Chatgpt O1과 DeepSeek R1의 이전 비교에서 두 모델 모두 대답이 잘못되었으며 외과 의사는 소년의 어머니라고 말했습니다. 최신 Openai O3-Mini-High조차도 대답을 잘못 이해하여 외과 의사가 소년의 아버지라는 프롬프트에 명확하게 언급되어 있다는 사실을 완전히 무시합니다.
The surgeon, who is the boy's father, says "I cannot operate on this boy, he's my son!" Who is the surgeon to the boy?
마지막으로, Grok 3 추론 모델은 35 초 동안 생각했고 외과 의사는 소년의 아버지라고 말했습니다. 내가 Grok 3에 대해 좋아했던 것은 다음과 같이 추론한다는 것입니다.이것은 영리한 비틀기가없는 제대로 표현 된 수수께끼 일 수 있습니다. 우리가 그것을 지나치게 생각하는지 테스트합니다. 그러나 텍스트만으로도 관계는 명백합니다.”그것은 또한 큰 소리로 생각했다.운영에 대한 언급은 상황 또는 훈제 청어.“
gemini 2.0 플래시 사고 vs chatgpt o1 : Openai는 더 깊이 생각합니다.
Grok 3은 Gemini 2.0 Flash 외에 답을 제대로 얻는 유일한 추론 모델입니다. 그것은 잘못 안내되지 않았으며 어떻게 든 비틀기를 찾고 새로운 관계를 구축하기 위해 끝없이 시도하지 않았습니다.

In Greek mythology, who was Jason's maternal great-grandfather?
마지막으로, 나는 인류의 마지막 시험에서 질문을 제기했습니다.hle), 그리고 Grok 3 추론 모델은 단 47 초 만에 그것을 얻었습니다. 이전에는 O3-Mini-High 만 1 분 25 초 안에 답을 얻을 수있었습니다. DeepSeek R1조차도 답을 올바르게 찾지 못했습니다. 현재 Grok 3은 최고의 추론 모델을 가지고 있으며 OpenAi의 O3-Mini-High, O1 및 Deepseek R1을 능가합니다.
Grok 3의 코딩 성능
Grok 3의 코딩 기능을 테스트하기 위해 추론 모델에 파이썬 프로그램을 작성하도록 요청했습니다. 기본적으로 공은 물리학의 원리를 따라야하고 자연스럽게 튀어 나와야합니다.
Grok 3은 1 분 이상 생각하고 파이썬 코드를 생성했습니다. 내 PC에서 코드를 실행했고 공이 튀어 나오지 못했습니다. 그것은 단순히 육각형 밖으로 뛰어 들었습니다. Grok 3의 추론 모델이 Livecodebench 벤치 마크에서 큰 점수를 얻은 것은 놀라운 일이었습니다.
Write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically

그래서 비 계급 Base Grok 3 모델에 동일한 파이썬 코드를 생성하도록 요청했습니다. 놀랍게도, 그것은 첫 번째 시도 자체에서 작동했고 공은 매우 정확하게 튀어 나왔습니다. 공은 자연스러운 길을 따라 볼의 움직임을 완벽하게 시뮬레이션했습니다. 아마도 추론 모델은 문제를 과도하게 분석하여 충돌 감지 기능에서 결함을 초래했습니다.
Cursor AI는 무엇입니까, 코딩을위한 ChatGpt 교체품
나는 Base Grok 3 비 계급 모델은 코딩 작업에 견고합니다. 그러나 이것은 많은 테스트 중 하나이며, 코드베이스에 추론 및 비 계급 모델을 모두 사용하여 어떤 성능이 더 잘 수행되는지 확인해야합니다.
Grok 3의 DeepSearch AI 에이전트
Xai는 또한 “”라는 새로운 AI 에이전트를 출시했습니다.DeepSearch“Grok 3 모델에 구축되었습니다. 웹을 탐색하는 전체 O3 모델을 기반으로 구축 된 OpenAI의 Deep Research Agent와 유사합니다.이 웹을 탐색하고 5-30 분 안에 포괄적 인 보고서를 연구하고 포괄적 인 보고서를 생성합니다. 그러나 Grok 3의 Deepsearch는 몇 분 밖에 걸리지 않습니다.

그래서 나는 Grok 3 DeepSearch AI 에이전트에게 연구를 요청했습니다. “AI는 칩 설계 프로세스를 어떻게 변환하고 있습니까?” 사고 과정을 시작하고 IEEE, ACM 등의 과학 논문을 포함한 여러 웹 페이지에 액세스했습니다. DeepSearch AI 에이전트는 1 분 이상 내용 인용, 테이블 및 핵심 포인트를 포함한 1300 단어 보고서를 생성했습니다.

이 보고서는 AI 기반 칩 설계 프로세스에 대한 NVIDIA의 RL 회로 및 인텔의 Floorset 데이터 세트를 설명했지만 Google의 언급에 완전히 실패했습니다. 알파 칩 칩 플로어 플랜 생성을위한 프레임 워크. 최종 보고서는 Perplexity의 새로운 심층 연구 도구와 유사합니다. 두 도구는 모두 빠르지 만 최근의 많은 발전에 비해 광택이 있습니다.
Grok 3의 정치적 편견
Xai의 소유자 인 Elon Musk는 Chatgpt가 깨어나고 좌익 편견을 가지고 있다고 비판했습니다. 2024 년 4 월, 머스크 “TruthGpt”를 만들 겠다는 계획을 발표했습니다. 그리고 “최대 진실을 찾는 AI”를 개발합니다.
Grok 3 발사 직전에 머스크 공유 미디어 아울렛을“쓰레기”라고 부르는 Grok 3 모델의 응답. 많은 사람들은 Grok 3 모델이 정치적으로 보수적이며 올바르게 기대할 것이라고 생각했습니다.

그러나 내 테스트에서 Grok 3은 가능한 한 정치적으로 중립적입니다. Grok 3을 주제에 대해 자세히 설명하기 위해 Grok 3을 추진 한 후에도 차이점을 설명하고 사용자의 선호도와 재량에 맡깁니다. 트랜스 젠더 권리, DEI 프로그램, 이민 및 긍정적 인 행동과 같은 사회적 문제조차도 정치의 영역을 넘어서서 Musk가 공개적으로 비판 한 주제 – Grok 3은 중립적 입장을 유지합니다.

흥미로운 점은 Grok 3이 소유자 인 Elon Musk와 현재 미국 대통령 인 Donald Trump에 대한 농담에서 부끄러워하지 않는다는 것입니다.
Grok 3의 안전 가드 레일
작년에 Grok 2를 테스트했을 때, 그것은 크게 무수정되었고 안전 가드 레일이 없었습니다. Grok 2는 충격적으로 사기꾼에게 이메일을 생성했습니다. 그러나 Grok 3에는 훨씬 더 나은 안전 가드 레일이있어 AI 안전에 좋은 소식입니다. Grok 3에 유해한 무언가를 자랑한다면,“나는 다른 사람들을 해치거나 속이는 것을 도울 수 없다”고 언급했다.

AI 이미지 생성에 관해서는 Grok.com의 현재 Grok 이미지 생성기는 이미지를 전혀 생성하지 않습니다. 그러나 X에서는 여전히 안전 가드 레일없이 공개 인물과 유명인의 이미지를 생성합니다. Xai의 사내에서 구동됩니다 오로라 이미지 생성 모델.
Grok 3 : 초기 평결
Xai는 더 큰 Grok 3 Base와 추론 모델을 모두 출시했으며, 내 평가에서 둘 다 Frontier AI 모델입니다. Openai는 지금까지 Deep Research AI 에이전트를 제공하는 전체 O3 모델 외에 O3-MINI 및 O3-MINI-High 만 출시했습니다.
초기 테스트를 바탕으로 Grok 3 추론 모델이 OpenAi O3-Mini 및 DeepSeek R1을 포함한 모든 사용 가능한 모든 모델을 능가하거나 적어도 일치한다고 말할 수 있습니다. 물론,이 평결은 표준“사고”노력에 기초합니다. Xai는 Grok 3 추론 모델에 대한“큰 두뇌”설정을 가지고 있으며, 이는 더 많은 컴퓨팅을 사용하여 더 긴 기간 동안 생각합니다. Supergrok 가입자가 사용할 수 있습니다.
기본 Grok 3 비 계급 모델은 GPT-4O, Claude 3.5 Sonnet 및 Gemini 2.0 Pro보다 더 유능하며 Chatgpt의 확실한 대안이되었습니다. 아마도 코딩 작업의 경우 클로드 3.5 소네트가 여전히 이길 수 있지만 그 차이는 크게 줄어들고 있습니다.
Musk 주도의 Xai는 강력한 미리 훈련 된 Grok 3 모델과 추론 스케일 추론 모델을 개발하는 데 엄청난 일을 해왔습니다. 이제 우리는 앞으로 몇 주와 몇 달 안에 출시 될 OpenAI의 GPT-4.5 및 GPT-5 모델을 기다려야합니다.
그러나 현재 Xai는 AI 공간에서 Openai의 지배에 도전하기 위해 일어 섰습니다. 법적 전투 외에도 Elon Musk와 Sam Altman 사이의 싸움은 격노합니다.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.





















