AI 코딩 도구 고르는 기준 - 점수표가 없는데 하나만 어떻게 고르나

결제 전에 성능 순위부터 뒤지는 건 자연스럽습니다. 잘못 고르기 싫어서 그러는 거니까요. 저도 그렇게 시작했습니다.

그런데 이 주제로 나온 글 대부분은 벤치마크 숫자를 늘어놓고 끝납니다. 회사마다 시험지가 따로 있다는 사실은 빼놓고요. 다른 시험 점수를 나란히 놓는 순간 그 비교는 이미 틀린 겁니다.

그래서 여기서는 점수를 빼고 셋으로만 가릅니다. 도구 성격, 회사가 돈 받는 구조, 최근 여섯 달의 조건 변경 이력. 코딩을 잘 모르는 비개발자를 위한 판단 기준입니다.

코딩 에이전트 세 개를 동사로 가른 표 — 클로드 코드는 채우고, Codex는 고르고, 안티그래비티는 벌인다
점수 말고 성격으로 가른다.

먼저 인정할 것 - 순위표부터 찾는 게 이상한 건 아닙니다

비싼 걸 고르고 싶은 게 아니라 후회하기 싫은 겁니다. 그 마음에 맞는 도구가 순위표고, 다른 분야에서는 대체로 잘 작동합니다.

다만 이 분야에서는 그 도구가 지금 고장 나 있습니다. 원인은 취향이 아니라 자료 쪽에 있어요.

그 표가 없는 이유 - 시험지가 회사마다 따로 놉니다

회사마다 내세우는 평가가 다릅니다. 겹치는 이름 자체가 거의 없어요.

둘만 겹치는 평가가 하나 남긴 하는데, 제출한 모델 등급이 서로 어긋납니다. 72.7과 65.3을 나란히 놓아봐야 소용이 없다는 뜻입니다. 나머지 한 회사는 그 평가를 아예 공표하지 않았고요.

기각한 기준 회사 발표 점수는 서로 견줄 수 없어서 뺐습니다. 회사 밖 독립 지수도 봤는데, 코딩 부문 1위가 68점이고 5위가 63점이더군요. 다섯 모델이 5점 안쪽에 겹쳐 있어서 이것도 결제 근거로는 약합니다.
회사 발표 벤치마크는 시험지가 서로 달라 비교가 안 된다 — 대신 도구 성격, 돈이 막히는 곳, 다음 달 조건을 본다
순위표가 안 나오는 이유.

80.9 대 76.2 - 4월에 찍힌 값이라 안 씁니다

비교 글에서 이 두 숫자를 아직도 봅니다. 2026년 4월에 찍힌 값이고, 지금 리더보드에서는 붙어 있는 모델 이름조차 어긋나 있습니다.

남들이 계속 쓰는 숫자라도 죽었으면 죽었다고 말해주는 편이 낫습니다. 그래서 이 글에서는 안 씁니다.

잣대를 바꿉니다 - 성능 말고 성격, 돈, 다음 달

같은 방식으로 못 재겠으면 방식을 바꿨다고 밝히고 바꾸면 됩니다. 여기서 쓰는 건 셋입니다. 어떤 사람 손에 맞는가, 돈이 어디서 막히는가, 다음 달에도 같은 조건인가.

수치는 모두 2026년 8월 27일 시점에 공개돼 있던 문서에서 옮겼습니다. 셋을 직접 굴려 잰 기록이 아닙니다.

세 도구를 동사 하나로 - 채운다, 고른다, 벌인다

항목을 읽기 전에 서랍부터 만들어 두면 편합니다. 클로드 코드는 채웁니다. 지시에서 빠진 부분을 알아서 메웁니다. Codex는 고릅니다. 작업마다 어떤 모델로 처리할지 사람이 지정합니다. 안티그래비티는 벌입니다. 여러 개를 한꺼번에 굴리고 브라우저까지 직접 엽니다.

클로드 코드 - 지시가 엉성해도 굴러갑니다

💡 무엇을 해주나

시키는 말이 정교하지 않아도 빠진 부분을 알아서 메웁니다. 흔히 알잘딱깍센이라고 부르는 그 감각인데, 코딩을 잘 모르는 사람에게 유리한 건 정확히 이 성질 하나입니다.

💡 왜 그렇게 되나

명령창에서 열든 평소 쓰는 편집기 안에서 열든 돌아가는 엔진이 같습니다. 데스크톱 앱 안에 이미 들어 있어서 별도 설치 과정도 없고요. 내 컴퓨터에서 켜면 설정도 붙여둔 외부 도구도 그대로 따라옵니다.

짧게 끊어 쓰지 않으면 빨리 막힙니다

길게 이어 붙일수록 값이 오릅니다. 직전까지의 기록이 매 요청에 다시 실리는 방식이라서요. 문서에는 에이전트를 여럿 세워 계획을 짜게 할 때 보통의 일곱 배가 될 수 있다고 나옵니다. 짧게 끊어 쓰는 습관이 없으면 이 도구는 빨리 막힙니다.

Codex - 문장을 쓸 줄 아는 사람에게만 값을 합니다

앞의 클로드 코드가 모자란 지시를 메워준다면, 이쪽은 정확한 지시를 전제로 깝니다. 시킬 일을 스스로 설계할 수 있는 사람 쪽에 맞아 보입니다.

절약 손잡이가 있습니다

모델 등급이 상·중·하 셋이고 작업마다 지정합니다. 맨 아래 등급을 쓰면 읽어들이는 몫의 차감이 20분의 1로 줄어듭니다. 급한 일은 위로, 잡일은 아래로 나눠 던지는 운용이 성립합니다.

화면 밖 일도 시킬 수 있습니다

브라우저에 붙이는 확장을 쓰면 이미 로그인해둔 창을 그대로 잡습니다. 로그인해야 보이는 화면에서도 작업을 시킬 수 있다는 뜻입니다.

누가 쓰면 좋나

시킬 일을 조건까지 넣어 적을 수 있는 사람. 그리고 작업 종류에 따라 돈을 아껴 쓸 계산을 직접 하려는 사람입니다.

손잡이는 정밀한 지시에 달렸고, 맨 위 등급 값은 행사 중입니다

지시를 정밀하게 못 쓰면 위 손잡이가 통째로 죽습니다. 그리고 맨 위 등급 값은 지금 행사 중이에요. 회사가 보장한 시점이 2026년 11월 21일이고, 그다음 계획은 공개돼 있지 않고요.

안티그래비티 - 평판은 나쁜데 수리는 빠릅니다

평이 안 좋더라는 말이 돕니다. 제가 써본 게 아니라 들은 이야기고, 근거는 구글이 운영하는 개발자 포럼에 2026년 5월 19일 올라온 글입니다. NO IDE, NO Extension, NO SSH라는 반응이 달렸어요. 업데이트가 자동으로 돌면서 편집기가 없어진 사고입니다. 그런데 8월에 되돌아온 것들이 있어요. 20일에 편집기 확장이 풀렸고, 24일엔 소스 관리 화면과 터미널 탭이 다시 생겼습니다. 그 24일 글에서 회사는 그동안 창을 셋이나 오갔다고 스스로 인정했고요. 8월 한 달 동안 올린 공식 글이 여덟 건입니다.

크레딧 하나가 얼마어치인지 밝힌 문서가 없습니다

부족한 분량은 크레딧으로 메울 수 있습니다. 그런데 크레딧 하나가 얼마어치인지 밝힌 문서가 없어요. 표준 소비 가격으로 차감된다는 서술 한 줄이 전부입니다. 얼마를 쓰는지 계산해가며 일하고 싶은 사람에게는 이게 걸립니다.

돈 받는 길이 둘입니다 - 개인은 한쪽만 만납니다

여기서 가장 많이 어긋납니다. 회사가 돈 받는 방식이 둘인데, 개인 구독자는 그중 하나만 겪습니다.

조직 종량과금개인 정액 구독
청구 방식쓴 만큼 계산정액. 아무리 써도 그대로
1인당 금액오픈AI 월 100~200달러 / 앤트로픽 150~250달러월 2만 9천 원대
많이 쓰면청구서가 커짐어느 지점에서 막힘

가운데 줄을 잘못 읽는 경우가 많습니다. 저 달러 값은 개인 구독자가 카드로 긁는 돈이 아닙니다. 조직이 API나 크레딧으로 쓸 때 개발자 한 명당 평균이에요. 앤트로픽 문서도 정액제 이용자에게는 이 값이 청구 기준이 아니라고 못 박고 있습니다.

조직 종량과금과 개인 정액 구독의 차이 — 개인 구독자는 월 2만 9천 원대 정액만 만난다
달러 값은 개인이 긁는 돈이 아니다.

3만 원 언저리로 사는 것 - 금액이 아니라 사용량입니다

결제로 얻은 것은 돈의 값어치가 아니라 회사가 잡아둔 사용량입니다. 초과분을 따로 사지 않는 한 청구서는 안 움직입니다. 그 대신 어느 순간 화면이 멈춰요.

그러니 세 도구를 견줄 때 실제로 봐야 하는 값은 요금이 아니라 그 사용량이 얼마나 안정적인가입니다. 요금은 세 곳이 거의 같거든요. 그리고 그 사용량은 회사 쪽에서 조용히 조정할 수 있습니다.

사고 여섯 달 - 바꾼 쪽과 잘못 당겨진 쪽

여섯 달 사이에 세 회사가 돌아가며 한 번씩 사고를 냈습니다. 성격으로 가르면 두 무리예요.

성격사례대응
회사가 정해서 바꾼 것3월 한도 도달 속도 인정, 5월 강제 업데이트, 8월 31일 추가분 종료 예정공지를 따라가면 예측 가능
결정 없이 잘못 당겨진 것6월 26~29일 사용량 급소진 사고공지로는 못 잡음. 상태 페이지 확인

아래 줄이 더 불편합니다. 남용을 걸러내는 장치가 멀쩡한 계정까지 묶어버린 게 원인이라고 회사가 밝혔고, 사흘 만에 풀렸습니다. 아무 결정이 없어도 사고는 난다는 뜻이에요.

묶으면 틀립니다 구글의 5월 편집기 사고와, 며칠씩 이어지는 잠금은 원인이 다른 별개 사고입니다. 잠금 쪽은 다섯 시간마다 채워지는 규칙에 주간 총량이라는 조건이 붙어서 생겨요. 그 주 몫을 미리 당겨 쓴 뒤에는 다섯 시간이 지나도 그대로입니다.

오늘 결제해도 지금 조건이 그대로 가지는 않습니다. 앤트로픽이 5월부터 얹어주던 주간 한도 50%는 종료일이 8월 31일로 붙어 있고, 27일까지 더 늘린다는 공지가 안 올라왔습니다. 임시 조치는 임시로 보셔야 합니다.

한 문장 자가진단 - 시킬 일을 적어보세요

메모장을 열고 이번 주에 시키려던 일을 한 문장으로 적어봅니다. 조건과 결과물 형태까지 들어가야 합니다.

✅ 적혔다면

Codex 쪽이 값을 합니다. 지시가 정밀할수록 강해지는 도구고, 낮은 등급으로 돌려 쓰는 절약도 이때부터 의미가 생깁니다.

❌ 자꾸 뭉개진다면

클로드 코드입니다. 모자란 부분을 대신 메워주는 쪽이라 지시문 훈련이 안 된 상태에서도 결과가 나옵니다.

💳 그 앞에 걸리는 조건 하나

결제를 아직 안 하겠다면 클로드 코드는 여기서 빠집니다. 셋 중 공식 문서가 결제를 요구하는 건 이 도구 하나거든요. 남은 둘은 각자 다른 방식으로 무료 진입이 열려 있습니다. 다만 무료 등급끼리 크기를 견주려 들면 안 됩니다. 근거가 될 값이 공개돼 있지 않거든요.

한 문장 자가진단 — 지시가 뭉개지면 클로드 코드, 조건까지 적히면 Codex
시킬 일을 한 문장으로 적어보면 갈린다.

이 판단을 다시 할 때는 요금표가 손질되거나, 사용량이 조정되거나, 새 모델이 올라오거나, 얹어주던 임시분이 끝날 때입니다. 이 중 하나라도 움직이면 위 판정은 다시 해야 합니다.

반대 사례 하나 - 이 기준이 안 통하는 경우

지시문을 잘 쓰는 사람인데도 안티그래비티를 고르는 경우가 있습니다. 여러 개를 동시에 굴리고 브라우저를 직접 열어보는 방식이 필요한 사람이요. 이건 취향 문제라 위 진단으로 안 걸러집니다.

그리고 평판 자료에는 편향이 있습니다. 만족한 사람은 포럼에 글을 안 씁니다. 제가 위에서 인용한 것도 불만이 있는 쪽만 모인 표본이에요.

정리 - 셋을 다 깎고 남는 한 문장

처음에는 순위표 하나면 결론이 날 줄 알았는데, 세 도구를 다 깎아놓고 보니 남는 건 도구 이름이 아니었습니다. 1위 68점짜리 모델을 고른다고 5위 63점짜리보다 확실히 낫다고 말할 수 없는 상황은 그대로고요.

저라면 클로드 코드를 씁니다. 다만 그 이유가 성능이 아니라 지시가 엉성해도 굴러가는 성질이라는 게 이 글의 전부예요. 앞에서 순위로는 못 고른다고 해놓고 다시 순위를 들이대면 말이 안 되니까요.

그래서 오늘 하실 일은 결제가 아니라 확인입니다. 지금 쓰시는 도구 공식 문서를 열어 주간 한도에 숫자가 적혀 있는지 그것만 보세요. 숫자가 없다면 손에 쥔 건 금액이 아니라 회사가 잡아둔 사용량이라는 뜻입니다.

세 문서를 화면에서 하나씩 짚어가는 과정은 이 영상에 담았습니다.

댓글 남기기 → 목록으로