커피를 마시는 동안 컴퓨터가 세 개의 앱을 클릭하는 소리가 들립니다. 어시스턴트는 스프레드시트를 완성하고, 코드 조각을 수정하고, 필요한 논문을 정확히 찾아냅니다. 나는 가만히 앉아서 커서가 단순히 움직이는 것이 아니라 계획을 가지고 있다는 것을 깨달았습니다.
빠르게 말하는 모델과 빠르게 행동하는 모델을 테스트해 봤습니다. 이 모델은 계획과 실행을 모두 수행합니다. 이것이 워크플로, 팀, 그리고 다음 번 마감일에 어떤 의미가 있는지 알고 싶을 것입니다.
사무실 팀은 회의 후 파일을 다시 엽니다. GPT-5.4는 에이전트 워크플로, 연구 및 지식 작업을 개선합니다.
프로젝트 관리자가 “데크는 정오까지 완료해야 합니다”라고 말하면 갑자기 시간이 중요해집니다. GPT-5.4는 추론, GPT-5.3-Codex에서 상속받은 코딩 강점, 그리고 에이전트 워크플로를 하나의 모델에 통합하여 도구를 전환하지 않고도 슬라이드를 만들고, 스프레드시트를 편집하고, 문서를 작성하도록 요청할 수 있습니다.
무대 뒤에서 큐를 실행하는 기술자처럼 여러 앱에서 다단계 작업을 오케스트레이션하는 것을 지켜봤는데, 그 차이는 피상적인 것이 아닙니다. Codex 앱은 이제 최대 100만 토큰의 컨텍스트 창을 지원하므로 긴 연구 스레드, 전체 보고서 및 복잡한 스프레드시트가 하나의 세션에 유지될 수 있습니다. 도구 검색이 더 정확해져서 모델이 추측하는 대신 올바른 유틸리티를 찾습니다.
벤치마크는 주장을 뒷받침합니다. GPT-5.4는 44개 직업에 걸쳐 전문적인 지식 작업을 측정하는 GDPval에서 83%를 기록했습니다. Anthropic의 Claude Opus 4.6은 78%를 기록했습니다. 코딩을 위한 SWE-Bench Pro에서 GPT-5.4는 57.7%를 기록했습니다. 실용적인 컴퓨터 사용 테스트인 OSWorld-Verified는 75%의 정확도를 기록합니다. 숫자가 모든 것을 말해주지는 않지만 사무실에서 누가 무엇을 하는지 다시 생각하도록 유도합니다.
GPT-5.4로 데스크톱 앱을 실행할 수 있습니까?
예, 이전 릴리스보다 더 안정적으로 실행할 수 있습니다. ChatGPT Thinking 변형은 기본 컴퓨터 사용 및 다단계 자동화를 보여줍니다. 앱 작업을 실행하고, 명령을 연결하고, 도구 선택을 개선합니다. 제품 팀의 경우 이는 핸드오프가 줄어들고 “당신이 하고, 나는 검토할게” 루프가 줄어든다는 것을 의미합니다.
늦은 밤 검색이 해결된 인용으로 이어졌습니다. GPT-5.4는 에이전트 웹 검색 및 사실에 더 능숙해졌습니다.
새벽 2시에 모호한 방법론 논문을 찾고 통계를 확인하도록 요청했더니 소스를 찾아 방법론을 개략적으로 설명했습니다. GPT-5.4의 웹 검색 에이전트는 찾기 어려운 정보를 추적하고 링크 목록 대신 정리된 증거를 반환할 수 있습니다.
과학적 사실 테스트에서 GPT-5.4는 GPQA Diamond에서 92.8%를 기록했습니다. Google의 Gemini 3.1 Pro는 94.3%를 기록했습니다. OpenAI는 또한 환각 감소를 보고합니다. GPT-5.2에 비해 허위 주장이 33% 감소하고 오류가 18% 감소했습니다. 완벽하지는 않지만 모델은 측정 가능하게 더 신뢰할 수 있게 되었습니다.
이 모델은 손전등을 든 숙련된 사서처럼 작동합니다. 가장 관련성이 높은 볼륨을 체로 쳐서 확인하고 건네줍니다. 문헌 검토, 인용 수집 또는 제품 주장의 검증에 사용하되, 엣지 케이스 및 새로운 주장에 대해서는 회의적인 시각을 유지하십시오.
Gemini 및 Claude와 비교했을 때 GPT-5.4의 정확도는 어느 정도입니까?
간단히 말해서 경쟁력이 있습니다. GPQA Diamond: GPT-5.4는 92.8%, Gemini 3.1 Pro는 94.3%. GDPval: GPT-5.4는 83%, Claude Opus 4.6은 78%. 각 모델에는 강점이 있습니다. Gemini는 일부 과학적 QA에서 약간 앞서고 Claude는 특정 벤치마크에서 강하지만 GPT-5.4는 기본 컴퓨터 제어를 추가하면서 격차를 좁힙니다.
팀 동료가 “업그레이드”를 클릭했습니다. 출시, 가격 및 개발자에게 의미하는 바
제품 회의에서 누군가는 필연적으로 “누가 이걸 지불하고 있습니까?”라고 묻습니다. OpenAI는 GPT-5.4 Thinking을 ChatGPT Plus 및 Team 사용자에게 출시하고 있습니다. ChatGPT Pro 구독자는 더 강력한 GPT-5.4 Pro를 얻습니다. API 구매자의 경우 가격은 100만 입력 토큰당 2.50달러(2유로), 100만 출력 토큰당 15달러(14유로)로 설정됩니다.
이 토큰당 가격 책정은 GPT-5.4가 토큰 효율성을 개선하고 중복 쿼리를 줄이기 때문에 중요합니다. 실제로 더 많은 작업을 수행하는 데 더 적은 비용을 지출할 수 있습니다. 또한 신호입니다. OpenAI는 이 모델이 단순한 채팅 파트너가 아닌 워크플로 내부에서 사용되기를 원합니다.
개발자 및 제품 팀은 프로덕션에 푸시하기 전에 스테이징에서 에이전트 흐름을 테스트해야 합니다. 통합 지점에는 ChatGPT, Codex 및 GitHub Copilot 및 Microsoft의 AI 스택과 같은 플랫폼이 포함됩니다. 내부 자동화 또는 고객 대면 도구를 구축하는 경우 이 모델은 자동화 프로젝트의 비용 편익 계산을 변경합니다.
API에서 GPT-5.4의 가격은 얼마입니까?
API 가격: 100만 입력 토큰당 2.50달러(2유로) 및 100만 출력 토큰당 15달러(14유로). 환각 감소와 더 나은 도구 사용으로 인한 처리량 증가를 고려하십시오. 이전 모델보다 ROI가 더 빨리 나타날 수 있습니다.
오류가 비싼 작업에서 에이전트를 테스트하고 모델의 허위 주장 감소 및 작업 마찰 감소가 실제로 인원수 또는 배송 시간을 줄이는지 여부를 측정한 다음 누가 키를 유지할지 결정해야 합니다.
우리의 활동을 지원해주세요 ❤️
이 글이 마음에 드셨다면, 앞으로도 좋은 콘텐츠를 계속 발행할 수 있도록 팁을 남겨주세요.






















