Codex와 Claude Code, 우열보다 먼저 같은 시험지를 줘야 하는 이유

Codex와 Claude Code 중에 뭐가 더 낫냐는 질문은 자주 나오지만, 이 영상에서 내가 건진 건 어느 쪽이 이겼다는 결론이 아니었다. 구현 전에 AI가 질문하게 하고, 실제 입력 자료로 이해가 맞는지 확인하라는 작업법이었다.

2026년 8월 31일 올라온 코딩알려주는누나의 영상은 Codex 프로젝트 생성부터 요구사항 정리, 미리보기 수정, 플러그인과 예약 작업, Claude Code 비교까지 다룬다. 영상에서 소개한 기능을 그대로 따라 하기보다, 우리 작업에 가져올 만한 기준을 추려봤다.

AI 생성 일러스트 · 막연한 아이디어가 확인된 요구사항과 구조화된 작업 흐름으로 이어지는 개념 그림
AI 생성 일러스트 · 막연한 아이디어가 확인된 요구사항과 구조화된 작업 흐름으로 이어지는 개념 그림

아래 이미지는 글의 작업 흐름을 보여주는 AI 생성 개념 일러스트다. 실제 Codex·Claude Code 화면이나 기능을 캡처한 것은 아니다.

질문을 시키는 것만으로는 부족하다

영상에서 가장 실용적인 순서는 간단하다. 해결할 업무와 불편을 설명하고, AI가 먼저 필요한 질문을 하게 한다. 답을 주고받은 뒤 요구사항을 다시 정리하게 하고, 그 내용을 확인한 다음 구현을 시작한다. 미리보기에는 주석이나 스크린샷을 붙여 구체적으로 수정한다.

여기까지는 맞는 얘기다. 그런데 회계 문서처럼 데이터 구조와 정확도가 중요한 작업은 질문을 많이 받았다고 끝나는 게 아니다. 실제 샘플 파일과 필드 정의가 있어야 하고, 민감정보를 어디까지 다룰지, 정상·이상 데이터를 어떻게 구분할지, 결과가 맞았다고 볼 기준이 무엇인지도 정해야 한다. AI가 이해한 입력 구조를 사람이 확인하는 단계까지 있어야 화면이 그럴듯한 것과 업무 결과가 맞는 것을 구분할 수 있다.

내가 이 순서를 적용한다면 먼저 실제 샘플을 주고, 입력 구조와 예외 상황을 AI가 어떻게 이해했는지 요약하게 하겠다. 요약이 맞는지 확인한 뒤에야 구현 계획을 세우는 식이다. AI가 질문했다는 사실보다 그 답이 실제 자료에 맞는지가 더 중요하니까.

AI 생성 일러스트 · 샘플 자료와 입력 항목을 확인한 뒤 승인 단계를 거쳐 구현 계획으로 넘어가는 과정
AI 생성 일러스트 · 샘플 자료와 입력 항목을 확인한 뒤 승인 단계를 거쳐 구현 계획으로 넘어가는 과정

비슷한 화면이어도 도구 차이가 사라지진 않는다

영상은 Codex와 Claude Code가 프로젝트를 만들고 결과를 확인하는 흐름이 비슷하다는 뜻에서 ‘101호와 102호’처럼 설명한다. 새 도구를 쓸 때 기존 작업 방식을 처음부터 배울 필요는 없다는 메시지는 이해된다.

다만 화면 흐름이 비슷하다고 차이가 버튼 위치뿐인 건 아니다. 모델, 권한 체계, 샌드박스, 연결할 수 있는 서비스, 작업 문맥과 사용량 조건이 선택에 영향을 줄 수 있다. 플러그인도 단순히 계정을 연결하는 기능만은 아니다. 내가 확인한 공식 문서 기준으로는 스킬, 커넥터, MCP 서버, 브라우저 확장, 훅, 예약 작업 템플릿 등을 묶을 수 있고, ChatGPT와 Codex에서 지원하는 범위도 서로 다르다. OpenAI 플러그인 문서

그래서 플러그인은 많이 연결할수록 좋다고 보기 어렵다. 이메일, 캘린더, 브라우저, GitHub, 배포 서비스까지 한 번에 붙이면 편해지는 만큼 접근 범위도 커진다. 읽기 전용 연결부터 시작하고, 외부 발송이나 배포처럼 바깥에 영향을 주는 작업은 실행 전에 확인하는 편이 낫다. 플러그인 설치가 모든 작업을 자동 승인한다는 뜻은 아니다. 연결 서비스의 권한과 Codex 호스트의 샌드박스, 개별 작업 승인 조건을 따로 살펴봐야 한다.

AI 생성 일러스트 · 외부 서비스 연결마다 접근 범위를 나눠 필요한 권한만 열어두는 개념 그림
AI 생성 일러스트 · 외부 서비스 연결마다 접근 범위를 나눠 필요한 권한만 열어두는 개념 그림

예약 작업은 작은 파일럿부터

영상에서는 매일 오전 8시에 Gmail과 Calendar를 읽고 업무 우선순위를 정리하는 예를 든다. 분석 노트에서 대조한 공식 문서에 따르면 데스크톱 앱의 예약 작업은 로컬 프로젝트나 격리된 worktree에서 실행될 수 있고, 플러그인과 스킬을 사용할 수도 있다. 로컬 파일이 필요한 작업이라면 컴퓨터가 켜져 있고 데스크톱 앱이 실행 중이어야 한다. OpenAI 예약 작업 문서

이 기능을 쓴다면 먼저 일반 채팅에서 요청을 시험하고, 초기 실행 결과를 확인한 뒤에 예약하는 쪽이 안전하다. 기본 샌드박스 조건을 살펴보고 필요한 최소 권한만 주는 것도 같이 가야 한다. 무인 실행을 편하게 만들겠다고 처음부터 Full access로 열어두면 파일 변경이나 네트워크 접근 범위가 커질 수 있다.

휴대전화에서 데스크톱 파일을 이어서 찾고 보내는 시연도 나온다. 다만 분석 노트에서 확인한 공식 문서 범위로는 그 정확한 경로와 권한, 계정별 제공 조건을 확정하지 못했다. 모바일에서 플러그인을 사용할 수 있다는 점과 데스크톱의 임의 파일을 가져올 수 있다는 점은 같은 말이 아니다. 회사 자료에 적용하기 전에는 실제 계정에서 파일 접근 범위와 전송 승인 절차를 확인해야 한다.

AI 생성 일러스트 · 켜져 있는 컴퓨터와 제한된 작업 공간에서 실행되는 예약 업무의 개념 그림
AI 생성 일러스트 · 켜져 있는 컴퓨터와 제한된 작업 공간에서 실행되는 예약 업무의 개념 그림

비교할 거면 같은 시험지를 줘야 한다

제작자는 회계 검토 앱 사례를 바탕으로 Codex는 비개발자 친화적인 질문과 화면, Claude Code는 보안·로컬 모델·샘플 파일·자료 구조 검증을 먼저 묻는 점을 좋게 평가한다. 비용 효율은 Codex, 개발 작업을 선호하는 사람은 Claude Code라는 추천도 덧붙인다.

그렇지만 이건 한 번의 제작 사례와 제작자 개인의 체감이다. 같은 프롬프트 전문, 모델 설정, 입력 파일, 수정 횟수와 평가 기준을 맞춘 반복 실험은 아니다. 특히 한쪽에 샘플 파일과 구조 검증이 더 많이 주어졌다면 정확도 차이가 도구 자체에서 왔다고 말하기 어렵다. 작업 절차가 달랐을 수도 있으니까.

둘을 제대로 비교하려면 같은 샘플 파일과 요구사항 문서, 같은 성공 기준과 수정 횟수를 줘야 한다. 평가도 UI 완성도, 데이터 정확도, 보안 관련 질문, 테스트 결과, 작업 시간, 사용량과 비용을 나눠 봐야 한다. 그래야 “Codex는 예쁘고 Claude는 정확하다” 같은 한 번의 인상이 결론으로 굳지 않는다.

AI 생성 일러스트 · 같은 입력 자료와 평가 조건을 두 비교 경로에 제공하는 개념 그림
AI 생성 일러스트 · 같은 입력 자료와 평가 조건을 두 비교 경로에 제공하는 개념 그림

우리 환경에는 이미 크론, 상태 확인, 실패 알림, 스킬 기반 작업이 있다. Codex 예약 작업이 데스크톱 프로젝트 문맥이나 worktree 격리에서 도움이 되는지는 로컬 코드베이스를 주기적으로 점검하는 작은 파일럿으로 비교해보면 충분하다. 기능이 있다는 이유만으로 기존 자동화를 한꺼번에 옮길 필요는 없어 보인다.

이 영상에서 결국 남는 건 도구 선택보다 입력과 검증 절차다. 실제 자료를 주고, AI가 이해한 내용을 확인하고, 같은 기준으로 결과를 비교한다. 앱 화면이 잘 떴다고 데이터까지 맞는 건 아니니까.

참고한 영상

https://www.youtube.com/watch?v=seWpr3HgXM4

댓글

이 블로그의 인기 게시물

줄눈 시공, 하는 게 맞나 — 안 하면 어떻게 되는지부터

신축 입주 시공, 어떤 순서로 했나 — 잔금부터 커튼까지 14일

조카가 맥북 네오를 샀다|윈도우 유저 단축키·추천 앱·설치법