2024년에 기술에 대해 논의한다면, AI 챗봇을 구동하는 생성 AI와 대규모 언어 모델(LLM)과 같은 트렌드 주제를 무시할 수 없습니다. OpenAI에서 ChatGPT를 출시한 후, 최고의 LLM을 구축하려는 경쟁이 몇 배로 커졌습니다. 대기업, 소규모 스타트업, 오픈소스 커뮤니티가 가장 진보된 대규모 언어 모델을 개발하기 위해 노력하고 있습니다. 지금까지 수백 개가 넘는 LLM이 출시되었지만, 가장 유능한 LLM은 무엇일까요? 알아보려면 2024년 최고의 대규모 언어 모델(독점 및 오픈소스) 목록을 따르세요.
1. GPT-4
OpenAI의 GPT-4 모델은 2024년에 출시된 최고의 AI 대용량 언어 모델(LLM)입니다. 2023년 3월에 출시된 GPT-4 모델은 복잡한 추론 이해, 고급 코딩 기능, 여러 학업 시험에서의 능숙도, 인간 수준의 성능을 보이는 기술 등 엄청난 역량을 보여주었습니다.
실제로 이것은 최초의 멀티모달 모델입니다. 텍스트와 이미지 모두 허용 입력으로. 비록 아직 ChatGPT에 멀티모달 기능이 추가되지 않았지만, 일부 사용자는 GPT-4 모델을 기반으로 하는 Bing Chat을 통해 액세스할 수 있습니다.
그 외에도 GPT-4는 환각을 해결하고 사실성을 1마일 정도 개선한 몇 안 되는 LLM 중 하나입니다. ChatGPT-3.5와 비교했을 때 GPT-4 모델 점수 사실적 평가에서 80%에 가까움 여러 범주에 걸쳐. OpenAI는 또한 인간 피드백(RLHF)을 통한 강화 학습과 도메인 전문가를 통한 적대적 테스트를 사용하여 GPT-4 모델을 인간의 가치에 더 부합하도록 만들기 위해 많은 노력을 기울였습니다.
GPT-4 모델은 1조 개 이상의 매개변수로 학습되었으며 최대 컨텍스트 길이를 지원합니다. 32,768 토큰. 지금까지 우리는 GPT-4의 내부 아키텍처에 대한 많은 정보를 가지고 있지 않았지만 최근 The Tiny Corp의 George Hotz가 노출된 GPT-4는 혼합 모델 각각 2,200억 개의 매개변수를 가진 8개의 이질적인 모델이 있습니다. 기본적으로, 앞서 이해했듯이, 하나의 큰 밀집 모델이 아닙니다.
마지막으로 ChatGPT 플러그인을 사용하고 GPT-4 모델을 사용하여 Bing으로 웹을 탐색할 수 있습니다. 몇 가지 단점은 응답이 느리고 추론 시간이 훨씬 길어 개발자가 이전 GPT-3.5 모델을 사용해야 한다는 것입니다. 전반적으로 OpenAI GPT-4 모델은 2024년에 사용할 수 있는 최고의 LLM이며, 진지한 작업에 사용하려는 경우 ChatGPT Plus에 가입하는 것을 강력히 권장합니다. 비용은 20달러이지만 지불하고 싶지 않으면 타사 포털에서 ChatGPT 4를 무료로 사용할 수 있습니다.
2. GPT-3.5
GPT 4에 이어 OpenAI가 GPT-3.5로 다시 2위를 차지했습니다. GPT-4와 유사한 범용 LLM이지만 특정 도메인에 대한 전문성이 부족합니다. 먼저 장점에 대해 이야기하면, 믿을 수 없을 정도로 빠른 모델 몇 초 안에 완전한 응답이 생성됩니다.
ChatGPT로 에세이를 쓰거나 ChatGPT를 사용하여 수익을 창출하는 사업 계획을 세우는 것과 같은 창의적인 작업을 던지든, GPT-3.5 모델은 훌륭한 일을 해냅니다. 게다가, 이 회사는 최근 GPT-3.5-turbo 모델에 대한 더 큰 16K 컨텍스트 길이를 출시했습니다. 잊지 말아야 할 점은, 무료로 사용할 수 있으며 시간당 또는 일당 제한이 없다는 것입니다.

그럼에도 불구하고 가장 큰 단점은 GPT-3.5입니다. 환각이 많이 온다 그리고 거짓 정보를 자주 토해냅니다. 그래서 진지한 연구 작업에는 사용하지 말라고 제안하고 싶습니다. 그럼에도 불구하고 기본적인 코딩 문제, 번역, 과학 개념 이해, 창의적인 작업의 경우 GPT-3.5는 충분히 좋은 모델입니다.
HumanEval 벤치마크에서 GPT-3.5 모델은 48.1%를 기록한 반면 GPT-4는 67%를 기록했는데, 이는 모든 범용 대형 언어 모델 중 가장 높은 수치입니다. GPT-3.5는 1,750억 개의 매개변수로 학습된 반면 GPT-4는 1조 개 이상의 매개변수로 학습되었다는 점을 명심하세요.
3. PaLM 2 (바이슨-001)
다음으로, 2024년 최고의 대규모 언어 모델 중 하나로 선정된 Google의 PaLM 2 AI 모델이 있습니다. Google은 PaLM 2 모델에서 20개 이상의 언어로 상식적 추론, 형식 논리, 수학 및 고급 코딩에 중점을 두었습니다. 가장 큰 PaLM 2 모델은 5400억 개의 매개변수로 훈련됨 최대 컨텍스트 길이는 4096개 토큰입니다.
Google은 PaLM 2를 기반으로 다양한 크기(Gecko, Otter, Bison, Unicorn)의 4가지 모델을 발표했습니다. 그중 Bison은 현재 출시되어 있으며 MT-Bench 테스트에서 6.40점을 받았고 GPT-4는 무려 8.99점을 받았습니다.

즉, WinoGrande, StrategyQA, XCOPA 및 기타 테스트와 같은 추론 평가에서 PaLM 2는 놀라운 작업을 수행하며 GPT-4보다 성능이 뛰어납니다. 또한 다국어 모델 그리고 다른 언어의 관용어, 수수께끼, 뉘앙스 있는 텍스트를 이해할 수 있습니다. 이것은 다른 LLM이 어려움을 겪는 부분입니다.
PaLM 2의 또 다른 장점은 응답이 매우 빠르고 한 번에 세 가지 응답을 제공한다는 것입니다. 저희 기사를 따라 Google의 Vertex AI 플랫폼에서 PaLM 2(Bison-001) 모델을 테스트할 수 있습니다. 소비자의 경우 PaLM 2에서 실행되는 Google Bard를 사용할 수 있습니다.
4. 클로드 v1
만약 모르셨다면, Claude는 Google의 지원을 받은 Anthropic에서 개발한 강력한 LLM입니다. 이 회사는 전 OpenAI 직원들이 공동 설립했으며, 그 접근 방식은 AI 어시스턴트를 구축하는 것입니다. 도움이 되고, 정직하고, 무해하다. 여러 벤치마크 테스트에서 Anthropic의 Claude v1과 Claude Instant 모델은 큰 가능성을 보여주었습니다. 사실, Claude v1은 MMLU 및 MT-Bench 테스트에서 PaLM 2보다 더 나은 성능을 보였습니다.

GPT-4와 비슷하며 MT-Bench 테스트에서 7.94점을 받은 반면 GPT-4는 8.99점을 받았습니다. MMLU 벤치마크에서도 Claude v1은 75.6점을 받았고 GPT-4는 86.4점을 받았습니다. Anthropic은 또한 다음을 제공하는 최초의 회사가 되었습니다. 가장 큰 컨텍스트 창으로 100k 토큰 Claude-instant-100k 모델에서. 기본적으로 단일 창에서 75,000개에 가까운 단어를 로드할 수 있습니다. 정말 미친 짓이죠? 관심이 있다면 지금 바로 Anthropic Claude를 사용하는 방법에 대한 튜토리얼을 확인할 수 있습니다.
5. 코히어
Cohere는 Google Brain 팀에서 일했던 전 Google 직원이 설립한 AI 스타트업입니다. 공동 창립자 중 한 명인 Aidan Gomez는 “주의는 당신에게 필요한 전부입니다” Transformer 아키텍처를 소개한 논문입니다. 다른 AI 회사와 달리 Cohere는 기업을 위해 존재하며 기업을 위한 생성적 AI 사용 사례를 해결합니다. Cohere는 소규모에서 대규모까지 다양한 모델을 보유하고 있습니다. 단지 6B 매개변수 52B개의 매개변수로 훈련된 대규모 모델.

최근의 Cohere Command 모델은 정확성과 견고성으로 칭찬을 받음. 에 따르면 스탠포드 HELMCohere Command 모델은 동종 모델 중에서 정확도가 가장 높습니다. 그 외에도 Spotify, Jasper, HyperWrite 등의 회사는 모두 Cohere 모델을 사용하여 AI 경험을 제공하고 있습니다.
가격 측면에서 Cohere는 다음과 같은 요금을 청구합니다. 100만 개의 토큰을 생성하려면 15달러가 필요합니다. 반면 OpenAI의 터보 모델은 같은 양의 토큰에 대해 4달러를 청구합니다. 그럼에도 불구하고 정확도 측면에서 다른 LLM보다 낫습니다. 따라서 사업을 운영하고 제품에 통합할 최고의 LLM을 찾고 있다면 Cohere의 모델을 살펴보세요.
6. 팔콘
Falcon은 이 목록에 있는 최초의 오픈소스 대규모 언어 모델이며, LLaMA, StableLM, MPT 등을 포함하여 지금까지 출시된 모든 오픈소스 모델을 능가했습니다. UAE의 기술 혁신 연구소(TII)에서 개발했습니다. Falcon의 가장 좋은 점은 Apache 2.0 라이선스로 오픈 소스화즉, 모델을 상업적 목적으로 사용할 수 있습니다. 로열티나 제한도 없습니다.

지금까지 TII는 두 가지 Falcon 모델을 출시했습니다. 40B 및 7B 매개변수로 훈련됨개발자는 이것이 원시 모델이라고 제안하지만, 이를 채팅에 사용하려면 대부분 사용 사례에 맞게 미세 조정된 Falcon-40B-Instruct 모델을 사용해야 합니다.
Falcon 모델은 주로 영어, 독일어, 스페인어, 프랑스어로 훈련되었지만 이탈리아어, 포르투갈어, 폴란드어, 네덜란드어, 루마니아어, 체코어, 스웨덴어로도 작동할 수 있습니다. 따라서 오픈소스 AI 모델에 관심이 있다면 먼저 Falcon을 살펴보세요.
7. LLaMA
LLaMA 모델이 온라인에 유출된 이후로 Meta는 오픈 소스에 올인했습니다. 공식적으로 다양한 크기의 LLaMA 모델을 출시했습니다. 70억개의 매개변수에서 650억개의 매개변수로. Meta에 따르면, LLaMA-13B 모델은 1,750억 개의 매개변수로 훈련된 OpenAI의 GPT-3 모델보다 성능이 뛰어납니다. 많은 개발자가 LLaMA를 사용하여 미세 조정하고 최고의 오픈소스 모델을 만들고 있습니다. 그렇긴 하지만, LLaMA는 연구 목적으로만 출시되었으며 TII의 Falcon 모델과 달리 상업적으로 사용할 수 없다는 점을 명심하세요.

LLaMA 65B 모델에 대해 말하자면, 대부분의 사용 사례에서 놀라운 성능을 보여주었습니다. Hugging Face의 Open LLM Leaderboard에서 상위 10개 모델에 속합니다. Meta는 모델을 훈련하는 데 독점적인 소재를 사용하지 않았다고 말합니다. 대신, 이 회사는 공개적으로 사용 가능한 데이터 CommonCrawl, C4, GitHub, ArXiv, Wikipedia, StackExchange 등에서 제공됩니다.
간단히 말해서, Meta가 LLaMA 모델을 출시한 후, 오픈 소스 커뮤니티는 빠른 혁신을 경험했고 더 작고 효율적인 모델을 만드는 새로운 기술을 내놓았습니다.
8. 과나코-65B
여러 LLaMA에서 파생된 모델 중에서 Guanaco-65B는 Falcon 모델에 이어 최고의 오픈소스 LLM으로 밝혀졌습니다. MMLU 테스트에서 Guanaco는 52.7점을 받았고 Falcon 모델은 54.1점을 받았습니다. 마찬가지로 TruthfulQA 평가에서 Guanaco는 51.3점을 받았고 Falcon은 52.5점으로 한 단계 더 높았습니다. Guanaco에는 7B, 13B, 33B, 65B 모델의 네 가지 종류가 있습니다. 모든 모델은 OASST1 데이터 세트에 대한 미세 조정 Tim Dettmers와 다른 연구자들에 의해 작성되었습니다.

연구자들은 과나코가 어떻게 미세 조정되었는지에 대해 다음과 같은 결론을 내렸습니다. QLoRA라는 새로운 기술 전체 16비트 작업 성능을 유지하면서 메모리 사용량을 효율적으로 줄입니다. Vicuna 벤치마크에서 Guanaco-65B 모델은 훨씬 더 작은 매개변수 크기를 가진 ChatGPT(GPT-3.5 모델)보다 성능이 뛰어납니다.
가장 좋은 점은 65B 모델이 단 24시간 만에 48GB의 VRAM을 가진 단일 GPU에서 학습했다는 것입니다. 이는 오픈소스 모델이 비용을 절감하고 품질을 유지하는 데 얼마나 발전했는지 보여줍니다. 요약하자면, 오프라인 로컬 LLM을 시도하고 싶다면 Guanaco 모델을 꼭 시도해 볼 수 있습니다.
9. 비쿠나 33B
Vicuna는 LMSYS에서 개발한 또 다른 강력한 오픈소스 LLM입니다. 다른 많은 오픈소스 모델과 마찬가지로 LLaMA에서 파생되었습니다. 감독된 지시와 훈련 데이터는 sharegpt.com에서 수집되었습니다.사용자가 놀라운 ChatGPT 대화를 공유하는 포털입니다. 자동 회귀 대규모 언어 모델이며 330억 개의 매개변수로 훈련됩니다.

LMSYS 자체 MT-Bench 테스트에서 7.12점을 받은 반면, 최고의 독점 모델인 GPT-4는 8.99점을 확보했습니다. MMLU 테스트에서도 59.2점을 달성했고 GPT-4는 86.4점을 받았습니다. 훨씬 더 작은 모델Vicuna의 성능은 놀랍습니다. 아래 링크를 클릭하여 데모를 확인하고 챗봇과 상호 작용할 수 있습니다.
10. MPT-30B
MPT-30B는 LLaMA에서 파생된 모델과 경쟁하는 또 다른 오픈소스 LLM입니다. Mosaic ML에서 개발했으며 다양한 소스의 방대한 데이터 코퍼스에서 미세 조정되었습니다. ShareGPT-Vicuna, Camel-AI, GPTeacher, Guanaco, Baize 및 기타 소스의 데이터 세트를 사용합니다. 이 오픈소스 모델의 가장 좋은 점은 8K 토큰의 컨텍스트 길이.

또한 OpenAI의 GPT-3 모델보다 성능이 뛰어나고 LMSYS의 MT-Bench 테스트에서 6.39점을 받았습니다. 로컬에서 실행할 소규모 LLM을 찾고 있다면 MPT-30B 모델이 좋은 선택입니다.
11. 30B-나사로

30B-Lazarus 모델은 CalderaAI에서 개발했으며 LLaMA를 기본 모델로 사용합니다. 개발자는 LoRA 조정 데이터 세트를 사용했습니다. Manticore, SuperCOT-LoRA, SuperHOT, GPT-4 Alpaca-LoRA 등을 포함한 여러 모델에서. 그 결과, 이 모델은 많은 LLM 벤치마크에서 훨씬 더 나은 성능을 보였습니다. Falcon과 Guanaco에 이어 HellaSwag에서 81.7점, MMLU에서 45.2점을 받았습니다. 사용 사례가 대부분 텍스트 생성이고 대화형 채팅이 아닌 경우 30B Lazarus 모델이 좋은 선택이 될 수 있습니다.
12. 위저드LM
WizardLM은 복잡한 지침을 따르도록 구축된 다음 오픈소스 대규모 언어 모델입니다. AI 연구자 팀은 초기 지침 세트를 다시 작성하는 Evol-instruct 접근 방식을 생각해냈습니다. 더 복잡한 지침생성된 지침 데이터는 LLaMA 모델을 미세 조정하는 데 사용됩니다.

이러한 접근 방식 덕분에 WizardLM 모델은 벤치마크에서 훨씬 더 나은 성능을 보이고 사용자는 ChatGPT 응답보다 WizardLM의 출력을 더 선호합니다. MT-Bench 테스트에서 WizardLM은 6.35점, MMLU 테스트에서 52.3점을 받았습니다. 전반적으로 13B 매개변수에 대해서만 WizardLM은 꽤 좋은 성과를 보이고 더 작은 모델에 대한 문을 열어줍니다.
보너스: GPT4All
GPT4ALL은 Nomic AI가 운영하는 프로젝트입니다. 내부 모델뿐만 아니라 지역 LLM을 실행하다 전용 GPU나 인터넷 연결 없이 컴퓨터에서. 꽤 잘 작동하는 13B Snoozy 모델을 개발했습니다. 저는 제 컴퓨터에서 여러 번 테스트했고, 엔트리 레벨 PC를 가지고 있다는 점을 감안하면 꽤 빠르게 응답을 생성합니다. 저는 또한 GPT4All에서 PrivateGPT를 사용했고, 실제로 사용자 지정 데이터 세트에서 응답했습니다.

그 외에도 다양한 조직의 12개 오픈소스 모델이 들어 있습니다. 대부분은 다음과 같습니다. ~에 내장됨 7B 및 13B 매개변수 무게는 약 3GB에서 8GB입니다. 무엇보다도 모델을 선택하고 바로 사용할 수 있는 GUI 설치 프로그램을 얻을 수 있습니다. 터미널을 건드릴 필요가 없습니다. 간단히 말해서, 사용자 친화적인 방식으로 컴퓨터에서 로컬 LLM을 실행하려면 GPT4All이 가장 좋은 방법입니다.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.






















