GPT-6 Astra와 Fable 5.1, 모델 교체보다 design.md를 먼저 보게 된 이유
안녕하세요. 밍슈의 분석노트입니다.
AI 뉴스 영상을 보다 보면 마음이 급해집니다.
새 모델이 나왔고, 컴퓨터를 직접 조작하고, 게임과 영상까지 만든다고 하니 지금 쓰는 환경을 전부 바꿔야 할 것 같아요.
그런데 이번 조코딩 영상을 보고 옵시디언에 남긴 내용을 다시 훑어보니, 정작 제 눈에 오래 남은 건 모델 이름이 아니었습니다.
GPT-6 Astra도 Fable 5.1도 아닌 design.md 쪽이었어요.

이번 자료는 2026-09-07 공개된 영상을 한국어 자동자막과 설명란 중심으로 분석한 기록입니다.
일부 발표 내용은 공식 자료와 대조했지만, 영상 속 데모를 제 환경에서 그대로 재현한 것은 아닙니다.
그래서 ‘가능해 보인다’와 ‘지금 제 작업에 안정적으로 쓸 수 있다’는 구분해서 봤습니다.
에이전트가 움직인다고 작업이 끝나는 건 아닙니다
Astra는 그림판, 슬라이드, Blender, 게임 제작과 영상 편집처럼 컴퓨터를 직접 다루는 사례로 소개됐습니다.
공식 발표에도 ARC-AGI-3 99.9%, FrontierMath Tier 4 98%와 컴퓨터·브라우저 조작 개선이 적혀 있습니다.
숫자는 확실히 눈에 들어옵니다.
다만 개별 제작 시간이나 사용량, 수능 평가 조건, 회로와 시뮬레이션의 정확성까지 이번에 재검증한 것은 아닙니다.
화면에서 한 번 멋지게 움직였다는 것과 편집 가능한 결과를 남기고, 요구사항을 지키고, 오류가 났을 때 복구하는 것은 또 다른 문제니까요.

Fable 5.1도 마찬가지입니다.
종합 벤치마크가 좋다는 설명과 긴 문제 해결 능력은 참고할 만하지만, 그림판 시연 하나로 복잡한 시스템 통합 개발의 우열까지 정할 수는 없습니다.
제가 복잡한 통합 작업에서 Fable 쪽을 더 좋게 평가했던 경험도 있어서, 기존의 작업 구분을 영상 한 편만 보고 뒤집을 이유는 부족해 보였습니다.
비용도 조심해서 봐야 합니다.
캐시 읽기 가격이 내려가 일반 토큰 작업 비용이 약 25% 줄 수 있다는 설명은 구독 한도가 늘었다는 뜻이 아닙니다.
월 구독 포함량과 API 과금, 벤치마크 한 번을 돌린 비용을 한데 섞으면 실제 판단이 흐려집니다.
이번에 정말 챙겨둔 건 design.md였습니다
Vercel의 사례에서 design.md는 예쁜 스타일을 적는 문서 하나가 아니었습니다.
독자가 무엇을 판단해야 하는지 정하는 design.md, 글꼴과 간격·색상 같은 반복 규칙을 제한하는 공통 CSS, 같은 조건으로 결과를 다시 비교하는 평가 과정이 한 묶음이었습니다.

이 부분이 꽤 현실적이었습니다.
‘AI 느낌 나지 않게’라고 다시 말하는 대신 금지할 패턴과 괜찮은 예시를 남깁니다.
‘모바일에서 보기 좋게’라면 정해진 화면 크기에서 가로 넘침, 본문 잘림, 버튼 접근성을 확인합니다.
‘브랜드답게’도 감으로 넘기지 않고 프로젝트별 색과 글꼴, 여백, 정보 구조를 나눠 적는 방식입니다.
그렇다고 design.md 한 장이면 끝나는 것도 아닙니다.
Vercel의 소규모 검사에서는 알려진 실패가 91건에서 39건으로 줄었지만 표본은 6개 페이지였습니다.
게다가 모든 페이지에 배포를 막을 정도의 문제가 남았다고 합니다.
문서가 마법을 부린 게 아니라, 반복해서 발견되는 실수를 수정 가능한 기준으로 바꿨다고 보는 편이 맞습니다.
제 환경에 적용한다면 여기부터입니다
새 구독을 늘리기 전에 자주 만드는 보고서나 웹 화면 하나를 고르는 게 먼저입니다.
기존 결과를 남겨두고, 같은 입력과 화면 크기로 디자인 기준을 넣은 결과를 비교합니다.
공통 CSS와 모바일 검사까지 붙여야 실제로 나아졌는지 볼 수 있어요.
회사 자료와 개인 글, 스포츠 사이트의 분위기는 한 규칙으로 억지로 합치지 않고 따로 두는 편이 맞고요.
Codex와 Fable도 모델 전체의 승자를 고르기보다 UI 수정, 구성요소 통합, 오류 재현과 수정처럼 실제 과업별로 비교하려 합니다.
첫 결과의 요구사항 충족 여부, 누락, 실제 테스트, 사람이 고친 횟수, 걸린 시간과 사용량을 기록하는 방식입니다.
아직 이 비교를 실행하거나 설정을 바꾼 것은 아닙니다.

작은 모델은 정답을 확인하기 쉬운 태깅과 분류부터 후보로 두면 됩니다.
법률·금융 판단이나 복잡한 디버깅처럼 틀렸을 때 비용이 큰 일은 가격만 보고 넘기기 어렵습니다.
불확실하면 강한 모델이나 사람에게 넘기는 경계도 함께 있어야 합니다.
Atlas와 공개형 영상 모델, 새 음성 도구도 당장은 보류 쪽입니다.
한국어 품질과 접근 조건, 라이선스, 장비 호환성, 장시간 안정성을 이번 자료만으로는 확인하지 못했습니다.
지금 제게 필요한 건 모델을 전부 갈아타는 일이 아니라, 매번 반복하던 지적을 눈으로 확인할 수 있는 기준으로 바꾸는 일에 가깝습니다.
design.md를 쓰고, CSS로 선택지를 줄이고, 같은 조건에서 다시 검사하는 것.
일단 반복 산출물 하나에 이 흐름을 붙여보는 게 가장 현실적으로 남았습니다.
댓글
댓글 쓰기