GPT-6 Astra와 Claude Fable 5.1 비교, 내 작업에서는 어떻게 나눠 쓸까
모델 비교 영상을 보고 나면 괜히 기본 모델부터 바꿔야 하나 싶을 때가 있습니다.
그런데 이번 자료를 다시 정리해보니 지금 해오던 배치를 굳이 뒤집을 이유는 없겠다는 생각이 먼저 들었습니다. 빠르게 초안을 보고 고쳐 나가는 일과, 오래 기다리더라도 여러 기능이 맞물린 첫 결과를 받는 일은 애초에 성격이 다르기 때문입니다.
이번 영상에서는 두 모델에 높은 추론 설정을 주고, 메타 프롬프팅 없이 짧은 요청을 한 번씩 넣었습니다. GTA 느낌의 게임, 도시 운영 게임, 모델 소개 웹사이트까지 세 과제를 맡겼어요.

빨리 보여주는 쪽, 오래 걸려도 연결하는 쪽
시간 차이는 꽤 컸습니다. GTA형 게임은 Astra가 25분 28초, Fable 5.1이 1시간 25분 48초 걸렸습니다.
Astra 결과는 차량과 인물 이동, 화면 분위기, 시설 배치가 빠르게 눈에 들어왔습니다. 다만 공격과 수배, 임무 완료 같은 핵심 반복 구조는 거의 작동하지 않았습니다. 넓어 보이는 지도에 비해 실제로 할 수 있는 일이 적었던 셈입니다.
Fable 5.1은 총소리와 피해, 수배, 사망 뒤 병원 재등장, 차량 탈취, 무기 구매까지 연결했습니다. 화면 하나를 예쁘게 만드는 데서 멈추지 않고 사용자가 그 장르에서 기대하는 놀이 구조를 더 깊게 채운 모습이었습니다.

도시 운영 게임에서도 비슷했습니다. Astra는 21분 만에 보기 좋은 도시 화면과 도로·구역·건물 생성을 보여줬습니다. 대신 전기와 수도, 주민 불만, 일자리, 화재, 자원 부족처럼 서로 물려 돌아가야 할 부분이 빠졌습니다.
Fable 5.1은 약 1시간 동안 작업했고, 전력망과 수도관을 연결하지 않으면 실제 부족 상태가 생기도록 만들었습니다. 성장에 따라 교통과 공원이 열리고 병원, 대출, 정책, 예산도 영향을 주고받았습니다.
소개 웹사이트는 Astra 11분, Fable 5.1은 27분이었습니다. Astra도 빠르고 품격 있는 화면을 만들었지만 Fable 쪽에는 맞춤 커서와 스크롤 반응, 카드 위에서 달라지는 상호작용이 더 들어갔습니다.

여기까지만 보면 Fable이 더 낫다고 바로 정리하고 싶어집니다. 그런데 그렇게 보기에는 조건이 꽤 다릅니다.
시험자는 한 명이고 과제도 세 개뿐입니다. Astra에만 약 1.5배 가속으로 설명된 빠른 모드가 적용됐고, Fable은 조사와 제작에 두세 배 이상의 시간을 썼습니다. 소스 코드 품질이나 테스트, 성능, 보안, 유지보수성도 비교하지 않았습니다. 토큰 사용량 역시 숫자가 아니라 체감만 언급됐고요.
짧은 요청 하나만 던지는 방식은 모델이 빈칸을 어떻게 채우는지 보기에는 좋습니다. 다만 요구사항과 평가 기준이 정리된 실제 개발 전체를 대신하지는 못합니다.
내 작업에 대입해보면
내가 지금 나눠 쓰는 기준은 그대로 두는 편이 맞아 보입니다.
일반 대화와 짧은 조사, 한두 파일 수정, 빠른 브라우저 탐색과 오류 재현처럼 중간 결과를 자주 보면서 방향을 바꿀 수 있는 작업은 Codex/Astra 계열이 잘 맞습니다.
반대로 복잡한 상태와 구성요소가 서로 연결되는 서비스, 말하지 않은 장르 관습까지 읽어야 하는 화면, 긴 시간 맡겨두고 통합된 첫 결과를 받고 싶은 작업은 Claude Code/Fable을 우선 후보로 둡니다. Fable을 모든 일에 쓰겠다는 뜻은 아닙니다. 한 번 맡긴 결과의 연결 완성도가 중요한 때에 꺼내는 쪽입니다.

두 번째 영상에서 눈에 들어온 design.md 이야기도 같은 방향입니다. 문서 하나만 넣는다고 디자인 문제가 끝나는 것은 아니었습니다. 판단 기준을 담은 design.md, 반복 규칙을 제한하는 공통 CSS, 같은 입력으로 비교하는 평가와 피드백이 함께 돌아가야 했습니다.
소개된 소규모 검사에서는 알려진 실패가 91건에서 39건으로 줄었지만 표본이 6개 페이지였고, 모든 페이지에 여전히 배포를 막을 문제가 남았습니다. 좋아졌다는 숫자와 실제로 쓸 수 있다는 판단은 또 다릅니다.
그래서 새 구독을 추가하거나 기본 모델을 갈아엎을 생각은 없습니다. 다음 실제 비교에서는 같은 저장소와 요구사항, 시간 한도, 빠른 모드 조건을 맞추고 테스트 통과율과 누락 요구사항, 사람이 고친 파일과 줄 수, 첫 사용 가능한 결과까지 걸린 시간, 토큰과 재시도 수를 남겨보려 합니다.
지금은 어느 모델이 무조건 위인지 정하는 것보다, 내 작업에서 기다린 시간만큼 손이 덜 가는지를 보는 게 더 맞겠습니다.
댓글
댓글 쓰기