URL: https://www.youtube.com/watch?v=c7W8jpsjtCc
날짜: 2026-08-13
채널: t3dotgg (Theo - t3․gg)
영상 길이: 25분 31초
자막: 영어 자동 자막을 기준으로 번역·정리함. 자막의 Grock/Gro는 Grok, GPT 5.6 Soul은 GPT-5.6 Sol, Deep sui는 DeepSWE로 문맥 보정함.
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==Grok 4.6은 장기 실행 에이전트와 코딩 성능에서 프런티어 모델에 합류했지만, 토큰 효율과 속도를 잃으면서 Grok 4.5가 갖고 있던 독특한 가격·속도 우위를 상당 부분 희생했다.==
- Cursor 인수 이후 xAI는 Grok 4.5와 4.6을 연속 출시하며 모델 개발 속도를 크게 높였다.
- Grok 4.6은 500k 컨텍스트, 장기 실행 에이전트, 자체 검증, 코드·리서치·앱 제작에 초점을 맞춘 Grok 4.5의 포스트트레이닝 확장판이다.
- Artificial Analysis Intelligence Index에서 61점을 받아 GPT-5.6 Sol과 나란히 섰고, DeepSWE와 FrontierCode에서도 큰 폭으로 올랐다.
- 실제 UI 디자인과 2D·3D 게임 제작에서는 Fable 5, Opus 5, GPT-5.6 Sol, Kimi K3보다 뒤처졌고, T3 Code의 실제 작업에서는 가능성과 불안정성이 동시에 드러났다.
- Grok 4.6은 더 똑똑해졌지만 30% 이상 많은 토큰을 사용해 비용과 대기 시간이 늘었다. 독특한 가성비·속도가 약해진 대신, Grok 4.7이 빠르게 프런티어를 따라잡을 가능성을 보여줬다.
1. 출시 배경과 첫인상
1.1. Cursor 인수 뒤 빨라진 xAI의 출시 주기
-
모델 출시 가뭄이 연속 출시로 바뀌었다
- Cursor를 인수한 뒤 xAI의 개발 속도가 눈에 띄게 빨라졌다.
- 한동안 의미 있는 모델을 거의 내놓지 않던 가뭄에서 벗어나 Grok 4.5와 Grok 4.6을 연달아 출시했다.
- Cursor 인수는 Cursor가 축적한 에이전트용 강화학습(RL)과 포스트트레이닝 노하우를 xAI가 활용할 수 있게 한 배경으로 제시된다.
-
Grok 4.5가 처음으로 현실적인 일상용 후보가 됐다
- Grok 4.5는 완전히 기본 모델로 사용할 정도는 아니었지만, Anthropic과 OpenAI가 아닌 연구소의 모델 중 처음으로 매일 운전해도 될 만큼 충분히 좋은 모델로 평가됐다.
- Grok 4.5는 발표자의 일상 작업에서 기본 선택은 아니었지만, 이전 Grok 계열과 달리 실제 코딩 작업에 투입할 수 있는 기준을 넘었다.
- Grok 4.6은 Grok 4.5의 장점을 더 밀어붙인 모델로 소개된다.
-
초기 체감은 빠르고 싸며 안정적인 장기 실행 능력이다
- Grok 4.6은 빠르고 저렴하며 안정적이고, 여러 하위 에이전트(sub-agent)를 거느린 장기 작업에서 목표를 잃지 않는다는 인상을 줬다.
- 에이전트가 오랫동안 복잡한 문제를 풀고 작동하는 결과물을 반환하는 능력은 에이전트 기반 개발이 확산될수록 중요해진다.
- 모든 문제가 해결된 것은 아니며, 직접 테스트에서 여러 거친 모서리와 실패 사례가 드러났다.
1.2. Grok Build CLI와 광고 구간
-
Grok Build CLI가 실사용 진입점으로 부상했다
- Grok Build CLI는 실제 사용 과정에서 긍정적인 평가를 받았고, Grok 4.6의 기능을 확인하는 주된 도구로 활용됐다.
- Grok 4.6에는 여러 층위가 있다. 인상적인 벤치마크, 실제 장기 작업, UI·게임 생성의 약점이 서로 다른 결과를 보여준다.
-
Mux가 영상 기능의 운영 부담을 해결한다
- 앱에 홈페이지 홍보 영상이나 사용자 업로드 영상을 넣을 때 영상이 제대로 제공·처리되는지, 부적절한 콘텐츠가 있는지, 캡션과 메타데이터를 어떻게 만들지 직접 해결해야 한다.
- Mux는 Fox, Bandcamp, Robinhood, Cursor, Dropbox 같은 서비스가 영상 인프라에 사용하는 플랫폼으로 소개된다.
- 사용자 생성 콘텐츠를 처리하고 관리하는 일은 큰 토끼굴이 되므로, 가능하면 직접 구현하지 않는 편이 낫다.
-
Mux Robots가 영상 자동화를 묶어 제공한다
- Mux Robots는 영상이 업로드될 때 AI로 질문에 답하게 하고, 캡션·콘텐츠 조정(moderation)·요약을 자동화한다.
- 한 개의 사이드 프로젝트 홈페이지부터 YouTube와 경쟁하는 서비스까지 동일한 영상 처리 문제를 다룬다.
- 영상 처리는 빠르게 비싸지지만, Mux를 이용하면 직접 모든 세부 기능을 구축하는 비용을 줄일 수 있다.
- Mux의 통합 코드를 읽기 전에 에이전트에게 물어보면, 오랫동안 영상의 기본 선택지였던 Mux를 이미 알고 있을 것이라는 농담이 이어진다.
- 광고가 안내한 주소는 https://sidv.link/mucks 이다.
2. Grok 4.6의 설계와 공식 설명
2.1. 새 사전학습보다 포스트트레이닝에 무게를 둔 업그레이드
-
Grok 4.5 위에 새 포스트트레이닝을 얹었다
- Grok 4.6은 완전히 새로운 사전학습(pre-training) 모델이 아니라 Grok 4.5를 기반으로 한 포스트트레이닝(post-training) 업데이트다.
- Cursor 인수를 통해 얻은 강화학습과 포스트트레이닝 기술이 긴 에이전트 작업의 신뢰성을 개선하는 데 사용됐다.
- 사전학습이 끝난 뒤 모델의 행동을 개선하는 포스트트레이닝이 장기 실행·에이전트 작업의 핵심 기법으로 설명된다.
-
장기 실행 에이전트와 인터랙티브·시각적 작업에 초점을 맞췄다
- 복잡한 작업을 여러 단계에 걸쳐 유지하고, 리서치·정보 분석·여러 코드베이스 작업을 이어간다.
- 넓은 제품 아이디어를 작동하는 첫 버전으로 바꾸고, 핵심 상호작용을 구현한 뒤 피드백을 받아 여러 차례 개선한다.
- 웹 앱 같은 작업 결과물뿐 아니라 디자인과 기타 작업 산출물도 다룬다.
2.2. 보강 학습과 에이전트용 데이터
-
Grok 4.5보다 긴 보충 학습을 진행했다
- 추론과 고급 기술 개념을 다룬 선별된 모델 생성 데이터가 사용됐다.
- 고품질 엔지니어링 데이터와 개선된 옵티마이저·학습 레시피가 지도 미세조정(SFT)과 강화학습(RL)의 기반을 강화했다.
- Grok 4.5로 추론 노력 수준별 SFT 궤적(trajectory)을 다시 생성하고, STEM·소프트웨어 엔지니어링·지식 작업용 에이전트 하네스에서 데이터를 모았다.
- 모델 기반 검사를 통해 문제가 있는 궤적을 걸러낸 뒤 더 강한 SFT 체크포인트를 만들었다.
-
다양한 에이전트형 RL 환경을 사용했다
- 일반 지식 작업과 코딩이 포함됐다.
- 커널 최적화, 웹 개발, 컴퓨터 지원 설계(CAD) 같은 도메인 특화 환경도 포함됐다.
- 단순한 질문 답변보다 여러 도구를 사용하며 긴 시간 동안 결과를 완성하는 능력을 직접 학습시키는 방향이다.
-
자체 테스트와 검증을 강화했다
- 긴 궤적에서 다음 작업으로 넘어가기 전에 자신의 결과를 확인하는 행동이 더 자주 나타난다.
- 기존 Grok 모델은 전체 코드를 한 번에 작성한 뒤 어떤 때는 작동하고 어떤 때는 실패하는 문제가 있었지만, 자체 검증은 그 문제를 줄이기 위한 변화다.
- 실제 게임 생성에서는 이 약속이 충분히 지켜지지 않았다는 반례도 확인됐다.
2.3. 안전성 평가와 테스트 대상
-
안전성·보안 능력을 함께 확장했다
- 새로운 능력과 잠재적인 해킹 가능성에 맞춰 안전장치를 추가했다.
- 사전 배포 능력 평가와 안전장치 보정에 가장 넓은 테스트 모음을 적용했다고 설명한다.
- 배포 후 테스트와 제3자 테스트도 광범위하게 진행됐다.
-
실제 코드베이스 보안 감사를 테스트했다
- “이 프로젝트를 철저히 보안 감사하고 출시 준비 여부와 우선 수정 항목을 알려 달라”는 작업이 부여됐다.
- 보안 감사 결과는 모델이 장기 작업에서 실제 코드베이스를 얼마나 잘 탐색하는지 확인하는 사례가 됐다.
3. 벤치마크, 가격, 토큰 효율
3.1. Artificial Analysis와 코딩 벤치마크
-
Artificial Analysis Intelligence Index에서 프런티어 범위에 들어섰다
- Grok 4.6은 Intelligence Index 61점으로 GPT-5.6 Sol과 동률을 기록했다.
- Claude Fable 5와 Opus 5 바로 뒤에 위치하며, 이전의 중간권 모델이 아닌 프런티어 범위에 진입했다.
- Grok 4.5보다 5점, Grok 4.3보다 23점 높은 수치로 소개된다.
- GDPval에서는 큰 상승이 있었지만 해당 벤치마크 자체에는 관심이 없다는 평가가 덧붙는다.
-
종합 벤치마크와 실제 사용성은 다르다
- 벤치마크 수치만으로 모델의 지능과 유용성을 측정하기 어렵다는 경고가 제시된다.
- Opus 5는 첫날에는 모든 지표에서 좋아 보였지만, 실제 코드를 여러 번 병합할수록 문제가 늘고 정리 작업이 많아졌다.
- 이런 경험 때문에 Opus 5를 “Opus sloppus”라고 부르게 됐고, 실제 사용에서는 Fable과 Sol을 더 선호한다는 평가가 나온다.
-
코딩 에이전트 벤치마크가 크게 올랐다
- DeepSWE 점수는 약 54%에서 66%로 상승했다. 최신 표기 기준으로 Grok 4.6의 DeepSWE 1.1 점수는 65.9%다.
- CursorBench도 상승해 GPT-5.6 Sol을 넘어섰지만, CursorBench 데이터 일부가 학습에 들어간 사실이 있어 결과 해석에 주의가 필요하다.
- CursorBench 3.2에서 Grok 4.5의 학습 데이터 오염 문제를 정리했을 가능성이 있지만, 발표자는 정확히 확신하지 못했다.
- FrontierCode 점수는 56.6%에서 61.3%로 상승해 Sol과 Fable 사이에 놓였다.
- AA-Briefcase와 Harvey Labs 평가에서도 최고 수준의 결과가 언급됐다.
3.2. 출시 경로와 사용 조건
-
Grok 4.6은 즉시 사용할 수 있다
- Cursor와 Grok Build에서 제공된다.
- 첫 주에는 Grok Build와 Cursor 구독에 2배 사용량이 제공됐다.
- xAI API와 여러 파트너 경로에서도 접근할 수 있다는 출시 정보가 함께 제시됐다.
-
X Premium 구독으로 테스트했다
- 이미 X에서 파란 체크를 받고 있어 별도 Grok 구독을 추가하지 않고 X Premium에 포함된 사용량을 활용했다.
- 광고가 없는 월 40달러 티어를 사용하며, X에서 받는 비용으로 구독료가 상쇄된다는 농담이 나온다.
- 해당 사용량으로 여러 게임을 만들고 T3 Code의 실제 작업을 진행했다.
-
T3 Code에서 Cursor와 Grok의 기능 일치를 확인했다
- T3 Code에는 Grok 바인딩이 들어가 있고, Grok Build 팀과 협력해 빠르게 통합했다.
- Cursor와 Grok 양쪽에서 같은 동작을 구현하려고 코드를 정리하는 작업에 Grok 4.6을 사용했다.
3.3. 가격 인하가 아니라 토큰 증가가 만든 트레이드오프
-
토큰당 가격은 경쟁력이 있다
- 입력 토큰은 백만 개당 2달러, 출력 토큰은 백만 개당 6달러다.
- Opus 5보다 60% 낮고 GPT-5.6 Sol보다도 낮은 가격으로 소개된다.
- Artificial Analysis 전체 작업의 비용은 약 0.84달러로, Kimi K3와 비슷하고 Gemini 3.6 Flash·Terra보다 조금 비싸며 GPT-5.6 Sol보다 조금 싸다.
- Fable 5의 실제 작업 비용 3.14달러와 비교하면 Grok 4.6은 0.84달러로 크게 저렴하다.
-
Grok 4.5와 비교하면 실제 비용이 두 배 이상 늘었다
- Grok 4.6의 실제 비용은 Grok 4.5보다 두 배 이상 높아졌다.
- 주요 원인은 실행당 토큰 수가 30% 이상 증가한 데 있다.
- Grok 4.5는 GPT-5.6 Sol보다 토큰 효율이 높은 몇 안 되는 주요 모델이었지만, Grok 4.6에서는 그 장점이 사라졌다.
- Grok 4.6은 여전히 Fable과 비슷하거나 더 나은 효율을 보이지만, 빠르고 작고 싼 모델이라는 독특한 위치에서는 벗어났다.
-
속도도 토큰 증가만큼 느려졌다
- Grok 4.5는 프롬프트를 보낸 뒤 바로 결과가 나와 이상할 정도로 빠르게 느껴졌다.
- Grok 4.6은 프런티어 모델처럼 프롬프트를 보낸 뒤 다른 일을 하러 가야 하는 대기 시간이 생겼다.
- 더 많이 생각해 지능과 장기 작업 능력은 올라갔지만, 속도와 비용이라는 Grok 4.5의 핵심 차별점은 약해졌다.
-
컨텍스트와 캐시 가격도 변했다
- 컨텍스트 창은 500k 토큰으로 유지됐다.
- 캐시 읽기 가격은 백만 토큰당 3센트에서 5센트로 올랐다.
- 토큰 증가와 캐시 가격 상승이 실제 실행 비용 증가에 추가로 영향을 줬을 수 있다.
3.4. Grok 4.7을 향한 가속
-
출시 속도 자체가 경쟁력이다
- Grok 4.6은 Grok 4.5 출시 한 달여 만에 Intelligence Index에서 5점을 올렸다.
- xAI의 출시 속도는 최근 매우 빨라졌고, 다음 버전도 빠르게 나올 것으로 보인다.
-
Grok 4.7 출시 계획이 공개됐다
- Elon Musk는 Grok 4.7이 Grok 4.6보다 크게 나아졌으며 3~4주 안에 준비될 수 있다고 게시했다.
- 초기 학습은 끝났고, SpaceX의 대규모 회사 데이터를 보충 학습에 추가하는 중이라고 알려졌다.
- Musk는 결과를 “something special”이라고 표현했다.
-
Pareto Frontier에서 위치가 바뀌었다
- Grok 4.5는 지능과 비용을 함께 고려할 때 가장 싸면서도 똑똑한 녹색 영역에 있었다.
- Grok 4.6은 지능 상승과 함께 비용·토큰·대기 시간이 늘어 로그 스케일 비용 그래프의 오른쪽으로 밀려났다.
- 프런티어 수준의 지능과 낮은 절대 가격은 여전히 매력적이지만, Grok 4.5가 제공하던 독보적인 비용 대비 속도는 더 이상 동일하지 않다.
4. UI·디자인 생성 실험
4.1. 기본 상태에서 만든 웹 디자인
-
Grok 4.6의 디자인 취향을 확인했다
- 별도의 디자인 스킬을 켜지 않은 상태에서 witchai.dev를 통해 여러 출력을 확인했다.
- 모델마다 디자인을 다르게 처리하는 차이를 비교하기 위한 실험이다.
- Muse 계열은 일반적인 Anthropic·OpenAI 스타일과 다른 시각적 결과를 냈지만, Grok 계열은 디자인 면에서 단순화된 버전처럼 느껴졌다.
-
첫 번째 디자인은 시각적 결속력이 부족했다
- 노이즈 패턴이 거슬리고, 흐릿한 배경 위에 지나치게 선명한 글자가 올라가 배경과 텍스트가 어울리지 않았다.
- 보라색 중심의 결과는 오래된 AI 디자인과 GPT-5.0 시기의 스타일처럼 느껴졌다.
- 화면 한쪽에 작은 목업 앱을 넣은 아이디어는 괜찮았지만 전체 구성은 카드가 너무 많았다.
-
여러 결과가 전형적인 템플릿에 머물렀다
- Tailwind 템플릿 같은 오래된 카드 중심 구성이 반복됐다.
- 많은 모델에서 보이는 브루털리즘 스타일과 중앙 정렬 랜딩 페이지도 등장했다.
- 호버할 때 떠오르는 카드 아이디어처럼 다듬으면 쓸 만한 결과도 있었지만, 전체적으로 완성도는 낮았다.
- 일부 결과는 “죄악스럽고 역겹다”고 표현될 정도로 조악했으며, 단순한 정리만으로 해결하기 어려운 시각적 문제가 있었다.
-
경쟁 모델이 시각 작업에서 앞섰다
- Fable 5는 같은 종류의 디자인을 훨씬 잘 만들었고, 차이가 우스꽝스러울 정도로 컸다.
- 터미널 스타일 결과는 싫었지만, Opus 5와 GPT-5.6 Sol도 Grok 4.6보다 의미 있게 나았다.
- GPT-5.6 Sol은 종종 촌스러운 결과를 내더라도 동일한 페이지 스타일을 더 세련되게 만들었다.
- UI·디자인 생성은 Grok 4.6의 약점으로 결론 났다.
5. Fish Slop 게임 생성 실험
5.1. 2D 수족관 게임 재구축
-
복잡한 시스템 관계를 보는 테스트를 만들었다
- 이전에 Opus 4.5로 만든 수족관 클론 게임 Fish Slop을 테스트 기반으로 사용했다.
- 기존 코드베이스를 참고하되 처음부터 새 게임을 만들라고 요청했다.
- 게임 시스템 사이의 관계를 이해하고 전체 작업을 수행하는지 확인하는 방식이다.
-
기본 조작과 밸런스에서 바로 문제가 드러났다
- 조작감이 나빴고 UI 요소 크기가 맞지 않았다.
- 물고기 먹이 알갱이는 지나치게 크고 물고기는 지나치게 작았다.
- 아래쪽에서 선택한 요소가 마우스를 옮긴 뒤에도 계속 강조되는 상태 버그가 있었다.
- 이동 감각이 좋지 않았고 게임 진행 속도도 틀렸다.
- 생물이 충분히 빨리 성장하지 않아 다음 단계로 넘어가는 데 너무 오래 걸렸다.
- Kimi K3가 같은 작업에서 Grok 4.6보다 의미 있게 나은 결과를 냈다.
5.2. 3D 포팅 실패와 복구
-
첫 3D 실행은 검은 화면으로 실패했다
- 3D 버전 게임을 열자 검은 화면만 나타났다.
- 지금까지 3D 게임 포팅을 맡긴 새 모델 중 처음으로 3D 환경 자체를 열지 못한 사례였다.
- 다른 모델은 이동·메커니즘·3D 모델에 버그가 있어도 최소한 3D 환경을 열었고, GPT-4도 그 단계까지는 도달했다.
-
스크린샷 피드백으로 실행은 복구됐다
- 실패 화면을 캡처해 Grok 4.6에 전달하고 수정하도록 했다.
- Grok Build CLI의 렌더링과 이미지·스크린샷 처리 UI 자체는 매우 좋다는 평가를 받았다.
- 수정 뒤 게임은 실행됐지만 품질 문제는 더 뚜렷하게 드러났다.
-
복구된 3D 게임도 핵심 방향과 배치가 무너졌다
- 위·아래 방향은 맞았지만 왼쪽·오른쪽 방향이 서로 뒤집혔다.
- 지면 위 오브젝트 배치가 완전히 어긋나 코믹할 정도로 잘못됐다.
- 물고기 3D 모델은 오랫동안 본 결과 중 최악에 가까웠다.
- 결과물은 한 세대 전 모델에서 나올 법한 수준으로 평가됐다.
-
Muse 1.2와 Kimi K3가 큰 격차로 앞섰다
- 더 저렴한 오픈 모델 Muse 1.2도 위·아래 기울기 같은 방향 문제가 있었지만, 실제로 실행되고 이동과 핵심 메커니즘이 훨씬 잘 작동했다.
- Kimi K3는 지면 오브젝트 모델링과 진행이 훨씬 앞섰고, 조명은 약간 깨져도 전체 완성도는 세대 차이를 보였다.
- Kimi K3는 오픈 웨이트 모델이라 온라인에서 가중치를 내려받아 사용할 수 있는데도 Grok 4.6보다 훨씬 나았다.
- 물고기 모델은 지금까지 본 모델 생성 결과 중 최고 수준으로 평가됐다.
6. 실제 코드베이스 작업
6.1. 보안 감사
-
과거 감사 기록까지 찾아냈다
- Grok 4.6은 Git 기록에서 과거에 수행된 보안 감사를 찾아냈다.
- 기존 기록을 발견한 점은 실제 코드베이스를 탐색하고 작업 맥락을 유지하는 능력을 보여줬다.
-
출시 전 우선순위로 여러 위험을 제시했다
- 브로커·워커 격리·스토리지·컨트롤 플레인 구조가 문제를 일으킬 수 있다고 지적했다.
- 엔드포인트 잠금 조치를 제안했다.
- 공개 접미사 목록(public suffix list)에 올리는 작업을 권고했다.
- 모든 캡슐 페이지에 Chrome을 실행하는 방안을 제시했다.
- 관리자용 신뢰·안전 UI를 완성하라고 했다.
- URL에 신원 토큰을 넣지 말라고 했다.
- 프로덕션에서 샌드박스 비활성화 플래그를 거부하라고 했다.
-
유용하지만 완전하지는 않았다
- 감사 과정에서 즉시 오류나 심각한 문제는 발생하지 않았고, 결과는 충분히 괜찮은 수준이었다.
- 더 깊은 문제를 모두 찾지는 못했지만, 실제 코드베이스를 대상으로 한 첫 보안 감사로는 허용 가능한 결과였다.
6.2. T3 Code의 ACP에서 Cursor SDK로의 이전 검토
-
현재 통합의 구조적 문제를 찾았다
- T3 Code는 Cursor CLI에 오래된 ACP 어댑터를 사용하고 있으며, Cursor가 유지보수하는 SDK로 옮기는 방향이 제시됐다.
- 장기 실행 GUI 호스트에는 모델 카탈로그, 작업 재개·취소, 이미지, 사용량 정보가 필요하다.
- Cursor가 실제로 유지하는 SDK가 이런 장기 실행 호스트에 더 적합한 계약인지 검토했다.
-
SDK 전환의 장점과 제약을 모두 파악했다
- 현재 ACP 호스트 계약이 맞지 않는 이유와 내장 폴백을 정리했다.
- 공식 문서의 라이선스가 MIT가 아니라는 점은 번거롭지만 수용 가능한 문제로 봤다.
- SDK에는 GUI 수준의 승인·거부 기능이 없지만, 대부분의 작업을 자동 실행하므로 치명적이지 않다고 판단했다.
- SDK는 질문을 중간에 차단해 사용자에게 묻는 흐름을 지원하지 않는다.
- 기존 에이전트 로그인을 재사용할 수 없어 별도의 로그인 구현이 필요하다.
-
계획 모드와 이벤트 처리에서 구현 결함이 나타났다
- 계획 승인 과정에서 클라이언트 연결이 끊기자 계획 승인이 완료되지 않았고 계획 모드가 계속 활성화됐다.
- 계획 내용이 UI에 나타나지 않아 사용성이 떨어졌다.
- 레거시 계획 모드를 다시 켜야 하는 상황이 발생했다.
- Grok Build ACP가 보내는 이벤트가 이상해 T3 Code가 UI에서 이벤트를 정리하는 추가 작업이 필요했다.
6.3. 계획 수립, PR 생성, 스택형 후속 작업
-
Grok Build 구현의 격차를 조사했다
- 다른 하네스와 비교해 T3 Code의 Grok Build 구현에 어떤 공백이 있는지 요청했다.
- Grok 4.6은 코드를 훑어 계획을 만들었지만, 계획이 UI에서 어디에 저장됐는지 찾기 어려웠다.
- HTML을 요청하자 HTML 스킬이 실행됐고, 이벤트가 깨져 UI가 결과를 다시 접어버리는 문제가 나타났다.
-
실제 PR을 만들고 후속 관리까지 수행했다
- 계획에 피드백을 주고 업데이트한 뒤, 전체 계획 파일을 구현하고 PR을 열어 지속적으로 관리하라고 지시했다.
- Grok 4.6은 Grok Build의 여러 기능 공백을 다루는 약 1,000줄 규모의 PR을 만들었다.
- GitHub에서 PR을 열어 확인한 결과, Macroscope의 피드백이 변경 사항을 강하게 비판하며 많은 수정을 요구했다.
- Grok 4.6은 지시를 대체로 잘 따랐고, 계정으로 피드백에 답했다.
- 모든 에이전트가 PR 댓글을 작성할 때 어떤 모델이 Theo를 대신해 답하는지 메모하도록 스킬에 지침을 넣어두었다.
-
로컬 작업 이력까지 사용한 스택형 PR을 추가했다
- 실제 컴퓨터의 작업 이력과 발생한 이벤트를 조사해 현재 코드가 놓친 공백을 찾도록 했다.
- 기존 PR 위에 별도의 PR을 스택으로 쌓아 추가 변경을 처리하도록 요청했다.
- 새 PR은 이전 PR과의 차이, 로컬 이력, 여러 스킬과 도구가 불러온 맥락을 동시에 추적해야 했다.
- 이런 경쟁하는 맥락을 유지하면서 서로 다른 다단계 작업을 한 스레드에서 일관되게 수행하는 능력이 Grok 4.5에서도 특히 인상적이었던 부분이다.
7. 모델별 주관적 점수표
7.1. Grok 45·Fable·Sol의 기준선
-
비용
- Fable은 지나치게 비싸다.
- Sol은 Fable보다 훨씬 낫고, Grok 4.5는 비용 면에서 압도적으로 좋았다.
-
지능
- Fable이 현재 최고 수준이다.
- Sol은 예상보다 훨씬 좋지만 Fable에는 조금 못 미친다.
- Grok 4.5는 두 모델보다 낮게 평가됐다.
-
속도
- Fable은 매우 느리다.
- Sol은 토큰 효율이 좋아 의미 있게 빠르다.
- Grok 4.5는 특히 빠른 모드에서 날아다닐 정도로 빨랐다.
-
철저함
- Fable은 사려 깊지만 여기저기 빠뜨리는 것이 있어 충분히 철저하지는 않다.
- Sol은 닿는 모든 부분과 가장자리를 확인하고, 그 결과 코드를 지나치게 많이 작성한다.
- Grok 4.5는 철저함 측면에서 강점이 없었다.
-
오케스트레이션
- Fable이 가장 뛰어나다.
- Sol이 의외로 가까이 따라온다.
- Grok 4.5는 대부분의 모델보다 낫지만 Fable과 Sol에는 못 미친다.
7.2. Grok 4.6의 변화
-
비용은 6점 안팎으로 하락했다
- 토큰당 단가는 크게 나쁘지 않지만, 토큰 효율 하락으로 전체 비용이 늘었다.
- Grok 4.5의 가장 중요한 차별점이었던 비용 우위가 약해졌다.
-
지능은 6.5점으로 상승했다
- 모든 작업에서 압도적으로 더 똑똑해졌다고 말할 정도는 아니지만, 의미 있는 개선은 분명하다.
- 장기 실행과 에이전트 작업에서 상승 폭이 특히 크다.
-
속도는 5.5점 정도로 크게 하락했다
- 더 많은 토큰을 생성하므로 완료까지 오래 걸린다.
- Grok 4.5의 빠른 응답감이 사라져 프런티어 모델과 비슷한 대기 경험이 됐다.
-
철저함은 조금 나아졌지만 빈틈이 남았다
- 자체 검증과 작업 유지 능력은 개선됐다.
- 실제 보안 감사와 PR 작업에서 유용한 결과를 냈지만, 계획·이벤트·게임처럼 실패가 빠르게 드러나는 부분도 있었다.
-
오케스트레이션은 6.5점으로 평가됐다
- 여러 하위 에이전트를 꽤 괜찮게 사용했다.
- 장기 실행 작업을 하나의 맥락으로 유지하는 능력은 확실한 강점이다.
8. 결론 및 시사점
-
Grok 4.6은 프런티어에 도달했지만 차별적 가성비는 후퇴했다
- Artificial Analysis 점수 61과 코딩 벤치마크 상승은 xAI가 프런티어 경쟁에 들어섰다는 신호다.
- 실제 작업에서 보안 감사, 코드베이스 탐색, PR 생성, 하위 에이전트 사용은 충분히 인상적이다.
- UI 디자인과 2D·3D 게임 생성은 Fable·Opus·Sol·Kimi K3보다 크게 약하다.
- 더 똑똑해진 대신 더 많은 토큰과 시간을 사용해 Grok 4.5의 독특한 속도·비용 조합을 잃었다.
-
벤치마크보다 작업 유형별 선택이 중요하다
- Intelligence Index 동률이 곧 동일한 개발 경험을 의미하지 않는다.
- CursorBench는 학습 데이터 오염 가능성이 있어 절대적인 모델 비교로 사용하기 어렵다.
- 디자인·게임·보안 감사·PR 오케스트레이션은 서로 다른 능력을 요구하므로 모델별로 결과가 크게 달라진다.
-
Grok 4.7의 잠재력이 이번 출시의 가장 큰 성과다
- 4.6이 4.5보다 빠르게 지능을 올린 속도는 고무적이다.
- 4.7에 SpaceX 데이터가 추가되면 장기 실행·코딩·도메인 지식이 더 좋아질 가능성이 있다.
- Grok 4.6은 가장 좋아하는 모델도 아니고 당장 많이 사용할 모델도 아니지만, Grok 4.7을 기대하게 만드는 출시다.
-
경쟁과 가격 인하가 시장에 필요하다
- 더 많은 프런티어 모델이 경쟁해야 사용자가 선택할 수 있다.
- 모델 지능뿐 아니라 실제 작업 비용과 에이전트 실행 속도를 함께 낮추는 경쟁이 중요하다.
- Grok 4.6의 진입은 xAI가 그 경쟁에 진지하게 참여하고 있다는 신호다.
영상 흐름
- 00:00–03:07: Cursor 인수 이후 빨라진 xAI, Grok 4.5의 첫 실사용 가능성, Grok 4.6의 장기 실행 강점과 한계, Artificial Analysis 점수 예고.
- 03:07–06:00: Mux의 영상 처리·캡션·조정·요약·Mux Robots 광고.
- 03:07–08:00: 공식 발표 내용, Grok 4.5 기반 포스트트레이닝, 장기 실행·인터랙티브·시각 작업의 목표.
- 08:00–12:15: 보안 평가, Intelligence Index·DeepSWE·CursorBench·FrontierCode 비교, 500k 컨텍스트·가격·토큰 증가·Grok 4.7 예고.
- 12:15–14:29: 기본 디자인 스킬 없이 만든 웹 UI 비교, Grok 4.6의 오래된 템플릿·브루털리즘·낮은 시각 완성도.
- 14:29–17:52: Fish Slop 2D·3D 게임 재구축, 조작·크기·진행·3D 포팅 실패, Muse 1.2와 Kimi K3 비교.
- 17:52–18:46: 실제 코드베이스 보안 감사와 발견한 출시 전 조치.
- 18:46–22:28: T3 Code의 ACP→Cursor SDK 이전, 이벤트·계획 모드 문제, 계획 수립과 약 1,000줄 PR 및 스택형 후속 PR.
- 22:28–24:59: 비용·지능·속도·철저함·오케스트레이션 기준의 Grok 4.6 주관적 점수표.
- 24:59–25:31: Grok 4.6은 최애 모델이 아니지만 Grok 4.7을 기대하게 하며, 더 많은 모델과 가격 경쟁이 필요하다는 결론.
주요 발언 모음
“Grok 4.6은 빠르고, 싸고, 안정적이며, 여러 하위 에이전트와 긴 작업을 수행하면서 해야 할 일을 잊지 않는다.”
“에이전트가 오랫동안 떠나 어려운 문제를 해결하고 작동하는 결과를 가지고 돌아오는 능력은 그 어느 때보다 중요하다.”
“이 수치가 실제로 가격의 5분의 1 수준에서 그렇게 가까운 성능을 보여준다면 상황은 빠르게 바뀐다.”
“벤치마크는 모델이 실제로 얼마나 똑똑하고 유용한지를 측정하는 최선의 방법이 아니다.”
“Grok 4.5에서 좋아했던 점은 특정 작업에서 프런티어만큼 좋았다는 것이 아니라, 속도와 비용이 프런티어와 충분히 달라 독특하게 유용했다는 점이다.”
“Grok 4.6은 내가 가장 좋아하는 모델인가? 아니다. 이 영상 뒤에 많이 쓸 것인가? 아마 아닐 것이다. 하지만 Grok 4.7은 확실히 기대된다.”
핵심 데이터 & 수치
- 영상 발행일: 2026-08-13.
- 영상 길이: 25분 31초.
- Artificial Analysis Intelligence Index: Grok 4.6은 61점으로 GPT-5.6 Sol과 동률이며, Grok 4.5보다 5점, Grok 4.3보다 23점 높다.
- DeepSWE 1.1: 약 54%에서 65.9%로 상승했다.
- CursorBench 3.2: 약 66.7%에서 69.9%로 상승해 GPT-5.6 Sol을 앞섰지만 Cursor 데이터 학습 오염 가능성이 있다.
- FrontierCode 1.1 Extended: 56.6%에서 61.3%로 상승했다.
- 컨텍스트 창: 500k 토큰으로 유지됐다.
- API 가격: 입력 백만 토큰당 2달러, 출력 백만 토큰당 6달러다.
- Artificial Analysis 작업 비용: Grok 4.6은 약 0.84달러, Fable 5는 약 3.14달러다.
- Grok 4.5 대비 비용: Grok 4.6의 실행당 토큰 수가 30% 이상 늘어 실제 비용이 두 배 이상 증가했다.
- 캐시 읽기 가격: 백만 토큰당 3센트에서 5센트로 올랐다.
- 첫 주 혜택: Cursor와 Grok Build 구독에 2배 사용량이 제공됐다.
- Grok 4.7 계획: 초기 학습 완료 후 SpaceX 데이터를 보충 학습 중이며 3~4주 내 출시가 예고됐다.
- 실제 코드 변경 규모: Grok Build 구현 공백을 다루는 약 1,000줄 PR을 생성했다.
참고 자료
- 공식 발표: https://x.ai/news/grok-4-6
- Artificial Analysis 모델 페이지: https://artificialanalysis.ai/models/grok-4-6
- Artificial Analysis Intelligence Index 언급 자료: https://x.com/ArtificialAnlys/status/2087598780086632522
- Grok 4.7 관련 SpaceXAI 게시물: https://x.com/SpaceXAI/status/2087562800982077492
- Mux 광고 링크: https://sidv.link/mucks
핵심 요약 (20줄)
- Cursor 인수 이후 xAI는 Grok 4.5와 Grok 4.6을 연달아 출시하며 모델 개발 속도를 크게 높였다.
- Grok 4.6은 Grok 4.5를 새로 사전학습한 모델이 아니라 Cursor의 강화학습과 포스트트레이닝 기법을 적용한 후속 모델이다.
- Grok 4.6은 장기 실행 에이전트, 복잡한 코드베이스, 리서치, 인터랙티브 앱, 시각 작업에 초점을 맞췄다.
- Grok 4.6은 긴 작업에서 여러 하위 에이전트를 사용하고 자신의 결과를 검증하는 행동을 더 자주 보인다.
- Artificial Analysis Intelligence Index에서 Grok 4.6은 61점을 기록해 GPT-5.6 Sol과 동률을 이뤘다.
- Grok 4.6은 Grok 4.5보다 Intelligence Index에서 5점, Grok 4.3보다 23점 상승했다.
- DeepSWE 점수는 약 54%에서 65.9%로 올라 장기 코딩 에이전트 성능의 큰 개선을 보여줬다.
- CursorBench 3.2 점수는 69.9%로 올랐지만 Cursor 데이터가 학습에 포함됐을 가능성이 있어 해석에 주의해야 한다.
- FrontierCode 점수는 56.6%에서 61.3%로 올라 GPT-5.6 Sol과 Claude Fable 5 사이에 자리 잡았다.
- Grok 4.6의 입력 가격은 백만 토큰당 2달러이고 출력 가격은 백만 토큰당 6달러다.
- Artificial Analysis 작업 비용은 Grok 4.6이 약 0.84달러로 Fable 5의 약 3.14달러보다 훨씬 낮다.
- Grok 4.6은 실행당 토큰을 30% 이상 더 사용해 Grok 4.5보다 실제 비용이 두 배 이상 증가했다.
- 토큰 증가 때문에 Grok 4.5의 빠른 응답감이 사라지고 프런티어 모델과 비슷한 대기 시간이 생겼다.
- 컨텍스트 창은 500k 토큰으로 유지됐지만 캐시 읽기 가격은 백만 토큰당 3센트에서 5센트로 올랐다.
- 기본 UI 생성에서 Grok 4.6은 노이즈, 과도한 카드, 오래된 템플릿, 브루털리즘, 낮은 시각적 결속력을 반복했다.
- Fish Slop 재구축에서 2D 조작과 진행이 나빴고 3D 포팅은 처음에 검은 화면으로 실패했다.
- Muse 1.2와 Kimi K3는 Grok 4.6보다 게임의 이동, 핵심 메커니즘, 지면 모델링, 3D 물고기 모델을 훨씬 잘 처리했다.
- 실제 보안 감사에서는 Git 기록, 격리 구조, 신원 토큰, 샌드박스 플래그 같은 출시 전 위험을 찾아냈지만 더 깊은 문제를 모두 발견하지는 못했다.
- T3 Code의 ACP에서 Cursor SDK로의 이전과 약 1,000줄 PR을 수행했지만 계획 모드와 이벤트 처리에는 여전히 구현 결함이 남았다.
- Grok 4.6은 최애 모델은 아니지만 빠른 지능 상승과 Grok 4.7의 SpaceX 데이터 학습 계획 때문에 더 강한 경쟁과 저렴한 모델의 미래를 기대하게 한다.
