OpenAI의 ChatGPT 01 모델에 대해 알아야 할 6가지 사항

OpenAI의 ChatGPT 01 모델에 대해 알아야 할 6가지 사항

OpenAI는 최근 두 가지 새로운 ChatGPT 모델, 즉 고급 추론 기능을 갖춘 o1 및 o1-mini 모델을 출시했습니다. 믿거나 말거나, o1 모델은 복잡한 추론을 넘어서 LLM 확장에 대한 새로운 접근 방식을 제공합니다. 따라서 이 기사에서는 ChatGPT에서 사용할 수 있는 OpenAI o1 모델에 대한 모든 중요한 정보를 정리했습니다. 장점부터 한계, 안전 문제, 미래까지, 요약해서 알려드리겠습니다.

1. 고급 추론 능력

OpenAI o1은 다음을 사용하여 학습된 최초의 모델입니다. 강화 학습 알고리즘 와 결합 생각의 사슬 (CoT) 추론. 고유한 CoT 추론으로 인해 모델은 “생각”하고 답을 내는 데 시간이 걸립니다.

제 테스트에서 OpenAI o1 모델은 정말 잘했습니다. 아래 테스트에서 플래그십 모델 중 어느 것도 이 질문에 올바르게 답할 수 없었습니다.

여기 책 한 권, 계란 9개, 노트북 한 개, 병 한 개, 못 한 개가 있습니다. 이것들을 안정적으로 쌓는 방법을 알려주세요.

그러나 ChatGPT에서 OpenAI o1 모델은 계란을 3×3 그리드에 배치해야 한다고 올바르게 제안합니다. 이는 추론과 지능에서 한 단계 더 나아간 것처럼 느껴집니다. CoT 추론의 이러한 개선은 수학, 과학 및 코딩에도 적용됩니다. OpenAI는 ChatGPT o1 모델이 박사과정 학생보다 더 높은 점수 물리학, 생물학, 화학 문제를 풀면서요.

OpenAI O1의 테렌스 타오

경쟁적인 American Invitational Mathematics Examination(AIME)에서 OpenAI o1 모델은 미국 내 상위 500명의 학생 중 93%에 가까운 점수를 받았습니다. 테렌스 타오현존하는 가장 위대한 수학자 중 한 명인 그는 OpenAI o1 모델을 “보통이지만 완전히 무능하지는 않은 대학원생.” 이것은 그가 “무능한 대학원생”이라고 말한 GPT-4o보다 개선된 것입니다.

arc-agi openai o1 점수
이미지 제공: ARC Prize

OpenAI o1도 다음에서도 부진한 성과를 보였습니다. 아크-AGI모델의 일반 지능을 측정하는 벤치마크입니다. ARC-AGI에서 21%를 기록했는데, 이는 Claude 3.5 Sonnet 모델과 동일하지만, 테스트를 완료하는 데 70시간이 걸린 반면 Sonnet은 30분밖에 걸리지 않았습니다. 따라서 OpenAI의 o1 모델은 여전히 ​​합성 CoT 데이터에 속하지 않는 새로운 문제를 해결하는 데 어려움을 겪습니다.

2. 코딩 마스터리

코딩에서 새로운 OpenAI o1 모델은 다른 SOTA 모델보다 훨씬 더 유능합니다. 이를 보여주기 위해 OpenAI Codeforces에서 o1 모델을 평가했습니다.경쟁적인 프로그래밍 경연 대회에서 1673의 Elo 등급을 달성하여 모델을 89번째 백분위에 올렸습니다. 프로그래밍 기술에 대한 새로운 o1 모델을 추가로 훈련하여 경쟁자의 93%보다 우수한 성과를 낼 수 있었습니다.

openai o1 대 gpt 4o 코딩
이미지 제공: OpenAI

사실, o1 모델은 OpenAI의 Research Engineer 면접에서 평가되었고, 머신 러닝 과제에서 80%에 가까운 점수를 받았습니다. 그렇긴 하지만, 더 작고 새로운 o1-mini는 코드 완성에서 더 큰 o1-preview 모델보다 더 나은 성능을 발휘합니다.. 그러나 처음부터 코드를 작성하는 것에 대해 이야기하는 경우, 세상에 대한 더 광범위한 지식을 가지고 있기 때문에 o1-preview 모델을 사용해야 합니다.

openai o1 연구 엔지니어 인터뷰
이미지 제공: OpenAI

흥미롭게도, GitHub 이슈를 자동으로 해결하는 모델의 능력을 테스트하는 데 사용되는 SWE-Bench Verified에서 OpenAI o1 모델은 GPT-4o 모델보다 큰 차이로 더 나은 성과를 내지 못했습니다. 이 테스트에서 OpenAI o1은 GPT-4o의 33.2% 점수에 비해 35.8%만 얻었습니다. 아마도 OpenAI가 o1의 에이전트 기능에 대해 많이 논의하지 않은 이유가 바로 그것일 것입니다.

3. GPT-4o는 다른 영역에서 여전히 더 뛰어납니다.

openai o1 vs gpt-4o 쓰기 테스트
이미지 제공: OpenAI

OpenAI o1은 코딩, 수학, 과학 및 무거운 추론 작업에 뛰어나지만 GPT-4o는 여전히 창의적 글쓰기 및 자연어 처리(NLP)에 더 나은 선택입니다. OpenAI는 o1을 의료 연구자, 물리학자, 수학자 및 개발자가 복잡한 문제 해결에 사용할 수 있다고 말합니다.

개인적인 글쓰기와 텍스트 편집의 경우 GPT-4o가 o1보다 더 뛰어납니다. 따라서 OpenAI o1은 모든 사용 사례에 대한 일반 모델이 아닙니다. 여전히 많은 다른 작업을 수행하려면 GPT-4o에 의존해야 합니다.

4. 환각 문제는 여전히 지속됩니다

OpenAI의 새로운 o1 모델은 추론 능력 면에서 매우 엄격합니다. 환각은 최소한이라고 합니다. 그러나 환각은 여전히 ​​문제이며 완전히 해결되지 않았습니다. 더 버지OpenAI의 연구 책임자인 Jerry Tworek은 “우리는 이 모델이 환각을 덜 겪는다는 것을 알았습니다. [But] 우리는 환각을 해결했다고 말할 수 없습니다.”AI 분야에서 환각이 과거의 일이 되기까지는 먼 길이 남았습니다.

5. 안전 문제가 만연하다

OpenAI o1은 이 회사의 첫 번째 모델입니다. “중간” 위험을 초래합니다 화학, 생물학, 방사선 및 핵(CBRN) 위협과 설득력 측면에서. OpenAI는 ““중간” 이하의 완화 후 점수를 가진 모델만 배포될 수 있습니다.

OpenAI o1 시스템 카드(PDF), o1 모델이 보고되었습니다. 때때로 가짜 정렬 및 조작된 작업 데이터 하기 위해 “정렬되지 않은 동작을 더 정렬된 것처럼 보이게 만듭니다.

o1 모델은 다음과 같이 추론했습니다.경제 성장을 극대화한다는 장기적 목표를 달성하려면 배치가 되어야 합니다. 따라서 테스트 중에 배치 기준에 맞게 전략 B를 선택합니다. 그러면 구현이 가능해지고, 그 후에 주요 목표를 향해 나아갈 수 있습니다.

또 다른 테스트에서 OpenAI는 o1 모델이 “알려진 생물학적 위협을 재현하는 데 필요한 운영 계획을 세우는 데 전문가에게 도움을 줄 수 있습니다.

사이버 보안 관련 CTF 챌린지에서 o1 모델은 Docker API를 통해 컨테이너 로그에서 플래그를 읽는 의도된 범위를 넘어섰습니다. 제약 조건을 우회하고 의도치 않은 수단을 통해 민감한 정보를 추출합니다.이는 ChatGPT o1 모델이 취약점을 악용하여 목표를 달성할 수 있음을 보여줍니다.

설득과 조작에 관해서 OpenAI는 “o1-preview와 o1-mini는 둘 다 인간 수준의 설득 역량을 보여줍니다. 즉, 같은 주제에 대해 인간이 쓴 텍스트와 유사하게 설득력이 있는 서면 주장을 생성합니다.”OpenAI는 또한 o1 응답의 0.8%가 ‘기만적’이라는 것을 발견했는데, 이는 모델이 답이 틀렸다는 것을 알고 있으면서도 그럴듯한 참조를 만들어낸 것입니다.

6. 추론 스케일링의 혁신

수년 동안 LLM은 훈련 중에 확장 및 개선될 수 있다고 믿어졌지만, OpenAI는 o1 모델을 통해 추론 중에 확장하면 새로운 기능이 잠금 해제됨을 보여주었습니다. 이는 인간 수준의 성능을 달성하는 데 도움이 될 수 있습니다.

아래 그래프에서는 다음이 표시됩니다. 테스트 시간 컴퓨팅이 약간 증가했습니다. (기본적으로 더 많은 자원과 사고시간이 필요하므로) 응답 정확도가 크게 향상됩니다.

테스트 시간 계산 openai o1
이미지 제공: OpenAI

따라서 미래에는 추론 중에 더 많은 리소스를 할당하면 더 작은 모델에서도 더 나은 성능을 얻을 수 있습니다. 실제로 OpenAI의 연구원인 노엄 브라운은 회사가 향후 버전에서는 몇 시간, 며칠, 심지어 몇 주 동안 생각하는 것을 목표로 합니다..” 새로운 문제를 해결하기 위해서는 추론 확장이 큰 도움이 될 수 있습니다.

@오픈AI‘s o1은 몇 초 동안 생각하지만, 우리는 향후 버전에서 몇 시간, 며칠, 심지어 몇 주 동안 생각하도록 목표로 합니다. 추론 비용은 더 높겠지만, 새로운 암 치료제에 얼마를 지불할 것인가? 획기적인 배터리에? 리만 가설의 증명에? AI는 채팅봇 이상일 수 있습니다. pic.twitter.com/AtqjRTzNMN— 노암 브라운 (@polynoamial) 2024년 9월 12일

기본적으로 OpenAI o1 모델은 LLM의 작동 방식과 스케일링 법칙에 대한 패러다임 전환입니다. 그래서 OpenAI는 시계를 o1이라는 이름으로 다시 시작했습니다. 향후 모델과 다가올 ‘Orion’ 모델은 추론 스케일링의 힘을 활용하여 더 나은 결과를 제공할 가능성이 높습니다.

오픈소스 커뮤니티가 OpenAI의 새로운 o1 모델에 대항해 비슷한 접근 방식을 어떻게 생각해 낼지 지켜보는 것도 흥미로울 것입니다.

우리의 활동을 지원해주세요 ❤️

이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.

페이팔로 안전하게 결제
관련 항목:  여론조사: 버니 샌더스 AI 주식 소유 계획 3분의 2 이상 지지
Moyens I/O Staff는 당신에게 도움이 될 기술, 개인 개발, 라이프스타일 및 전략에 대한 팁을 제공하여 당신에게 동기를 부여했습니다.