Matt Pocock이 스킬 29개에 예외 없이 적용한 규칙 — 인기 1위 스킬도 이 공식을 따랐다
AgentOS 채널이 Matt Pocock(토탈 타입스크립트 저자)의 스킬 레포를 분석해 좋은 스킬을 가르는 4단계 체크리스트를 정리한 영상이다.
불러오는 중입니다
AgentOS 채널이 Matt Pocock(토탈 타입스크립트 저자)의 스킬 레포를 분석해 좋은 스킬을 가르는 4단계 체크리스트를 정리한 영상이다.
Claude Code는 작년 2월 Sonnet 3.7의 부수적 기능으로 시작해 1년 반 만에 매 permission prompt를 검토하던 시대를 지나 Fable로 다수 기능을 원샷 구현하는 수준까지 진화했습니다.
1. Cua의 CEO Francesco Bonacci, CTO Dylan, Chief Infra Officer Robert 세 명이 함께 발표한 세션으로, Cua Driver·Cua Bench·Cua Fleet 세 제품을 순서대로 소개했다. 2. 기존 컴퓨터 사용 에이전트("1.0")는 스크린샷을 찍고 추론한 뒤 클릭/타이핑/스크롤로 화면을 직접 점유하는 "인간 흉내형 루프"였다. 3. Cua Driver는 사용자 화면을 빼앗지 않고 백그라운드에서 조용히 동작하는 최초의 크로스플랫폼(macOS·Windows·Linux) 드라이버라고 소개됐다. 4. macOS의 비공식(undocumented) 접근성 API를 활용해 만들었으며, 약 2개월 전 경쟁사의 컴퓨터 사용 모델 출시를 계기로 한 주말 만에 만들어졌다. 5. 액션 실행은 계층적으로 이뤄진다: 먼저 접근성 트리 기반 백그라운드 실행을 시도하고, 실패하면 픽셀 레벨 백그라운드 클릭으로 폴백한다. 6. 릴리스 간 회귀를 막기 위해 8개의 서로 다른 애플리케이션 하네스로 지속 테스트하며, Clicky·H Company·Droid Factory 등이 초기 도입 및 업스트림 기여 사례로 언급됐다. 7. Cua Bench는 터미널 전용 벤치마크(terminal-bench, Harbor)의 GUI 버전으로, 태스크가 setup·oracle(골든 트래젝토리)·evaluator 세 요소로 구성된다. 8. 단일 Python 파일로 5개 이상 데스크톱 플랫폼에서 동작하는 GUI를 작성·검증할 수 있는 SDK를 제공하며, 현재 130개 이상 검증 태스크와 42개 환경을 갖췄다. 9. Snorkel AI와 공동 구축한 전기공학(EE) 특화 벤치마크 "Cua Bench Kyad"에서 최고 에이전트조차 25개 태스크 중 6개만 완전 통과했다. 10. 통과한 6개는 전부 "기존 회로도 수정" 유형이었고, 백지 상태에서 새 회로를 설계하는 태스크는 성공률이 0%로 떨어졌다. 11. 테스트한 모든 모델 중 30% 보상을 넘긴 모델이 없어 리더보드가 "평평하다"고 평가됐다. 12. Cua Bench 기본 데이터셋을 4천 태스크로 확장한 결과, 기본 컴퓨터 툴 사용 시 통과율이 약 62%였다. 13. 동일 에이전트의 컴퓨터 툴을 Cua Driver로 교체하자 통과율이 80%로 오르고 토큰 사용량은 34% 줄었으며, 이는 관찰 범위를 데스크톱 전체가 아닌 활성 창(window)으로 좁혔기 때문이다. 14. 벤치마크 신뢰성 확보를 위해 에이전트들로 구성된 매트릭스가 먼저 리워드 해킹을 시도해 환경을 공격해보고, 그 결과를 코드리뷰 형태로 정리해 통과한 태스크만 데이터셋에 편입시킨다. 15. 발표자는 이 과정을 "결국 평가가 끝까지 이어지는 구조(evals all the way down)"라고 표현했다. 16. 에이전트의 "세계 모델" 수준은 기록된 실행을 임의 시점에서 포크한 뒤, 모델에게 보상/내부 상태를 예측하게 하고 실제 결과와 비교하는 방식으로 측정한다. 17. Robert는 RL 트레이닝 중 샌드박스 스핀업/리셋을 기다리며 GPU가 유휴 상태로 낭비되는 비용 문제를 지적했다. 18. 해결책으로 수요 기반 오토스케일러가 필요한 만큼 샌드박스 풀 크기를 실시간 조정하는 "Cua Fleet"을 소개했으며, 사전에 warm pool 크기를 정할 필요가 없다. 19. 풀에 쓰이는 인프라가 GPU보다 2~4배 저렴해 약간의 여분을 유지해도 전체 비용이 절감되고, GPU 활용률이 최대화된다고 설명했다. 20. Q&A에서는 Android가 ARM 팀과 협업 중이며 컨테이너화를 통한 백그라운드 작업이 가능하지만, 이는 GUI 제어보다는 "툴 유즈"에 가까운 형태라고 답했다.
Cursor의 ML 엔지니어 Lee Robinson이 AI Engineer 컨퍼런스에서 모델 훈련 방식과 재귀적 자기개선(RSI) 전략을 공개했습니다.
컨텍스트 엔지니어링은 RAG, 메모리, 에이전틱 히스토리 같은 추상화를 걷어내고 결국 "어떤 토큰을 모델에 넣을지"를 직접 설계하는 작업이라는 것이 이 대화의 출발점입니다.
PrismML이 Qwen3.6 27B를 기반으로 추론, 도구 호출, 비전, 컴퓨터 사용을 지원하는 Bonsai 27B를 출시했다.
Codex CLI의 MultiAgentV2가 spawnagent, sendmessage, followuptask 메시지를 암호화하기 시작했다.
같은 요청에도 결과가 달라지는 AI 제품에서 반복 오류를 줄이려면 지침을 늘리기보다 모델이 거스를 수 없는 결정론적 코드로 통제해야 한다.
HumanLayer CEO Dex Horthy가 컨텍스트 엔지니어링 용어를 창안하고 12-Factor Agents를 작성했다.
OpenAI가 화면 없는 이동형 스마트 스피커를 첫 소비자 기기로 출시 예정이며 인간형 AI 동반자 역할을 수행한다.
루프(loop)는 전체 워크플로우의 단 한 가지 측면에 불과하다
Cursor의 글로벌 FDE(Forward Deployed Engineering) 팀 리드 Pauline Brunet의 20분 발표입니다.
Ultra는 추론 레벨이 아니다 — 시스템 프롬프트에 서브에이전트 사용 지시를 추가하는 토글/스킬일 뿐이다.
Erik Meijer: 함수형 프로그래밍, LINQ 등으로 유명한 연구자
박종현: Fable로 코드 리뷰를 돌렸더니 5시간 Max 쿼터를 30분 만에 소진. Ultra 모드에서 에이전트를 동시에 많이 돌린 결과. "분명히 좋을 텐데, 리뷰 내용을 따라가는 게 오히려 느려서 일단 최대한 많이 돌려놓고 있다" → 인지가 산출물 속도를 못 따라가는 상황.
Block(Square, CashApp, Afterpay, Tidal)의 3,500명 엔지니어링 조직을 자율적 조직으로 전환한 당사자.
코딩 에이전트를 쓰는 사람 대부분이 스킬을 쓰지만 evals를 갖춘 사람은 거의 없다.
Atlan 창업자 Prukalpa Sankar: '인터넷 시대엔 콘텐츠가 왕, 에이전틱 시대엔 컨텍스트가 왕'이라는 주제 발표.
Engram은 $9,800만 시드를 받은 AI 메모리 스타트업으로, CEO Dan Biderman이 요리를 하며 핵심 기술 철학을 설명한다.
2026년 2월, CNN 비즈니스 헤드라인: "블록이 AI 때문에 직원을 절반 가까이 해고했다. CEO는 대부분의 회사가 똑같이 하게 될 거라고 말했다."
Will Brown (Prime Intellect 응용연구 리더)이 AI Engineer 컨퍼런스에서 현대적 사후 학습(Post-Training) 전체 구조 소개
OpenAI RL & Agent Infrastructure 팀의 Abhishek Bhardwaj가 '포크에서 플릿까지' 에이전트 샌드박스 클라우드 설계 원칙을 발표.
55 시절: 한 메시지당 5시간 limit의 0.1~2% 사용
Soul이 DeepSWE 최고점 73% 달성 — Fable보다 저렴하면서 더 높은 점수