오퍼스 5.5와 소넷 5.5를 같은 과제에 넣고 화면 비교 검사기를 쥐여 줬더니, 오퍼스는 90.6점, 소넷은 90.2점이 나왔습니다. 0.4점 차이로 어느 쪽이 낫다고 말할 수는 없어요.
모델 비교 글은 대부분 점수표 한 장으로 끝납니다. 그런데 확인을 되풀이하는 일에서 점수는 두 모델을 구분해 주지 못했어요. 구분은 그 90점까지 몇 번 확인했는지, 몇 분이 걸렸는지, 점수가 무엇을 놓쳤는지에서 났습니다.
이 글은 어느 모델이 더 똑똑한지는 다루지 않습니다. 확인할 도구를 줬을 때 두 모델이 어떻게 다르게 움직였는지만 다룹니다. 오퍼스 5.5와 소넷 5.5 중 반복 확인이 필요한 일을 어디에 맡길지 정하려는 분께 맞춘 글이에요.
두 모델은 같은 75점에서 출발했다
맡긴 일은 흐름도 그림 한 장을 받아, 마지막 프레임이 그 그림과 같아지는 5초 움직임을 짜는 것이었습니다. 1차 실행에선 읽기·쓰기 도구 말고는 아무것도 주지 않았어요. 결과는 75.2(오퍼스)와 75.4(소넷)였습니다.
채점은 저희가 직접 짠 방식으로, 원본과 내용이 겹치는 비율을 봅니다. 아무것도 없으면 0, 원본을 그대로 두면 100, 원본을 60픽셀(폭의 3% 남짓) 옮겨 놓기만 해도 57.4가 나와요. 75점이면 상자와 화살표는 대체로 맞고 손글씨 메모와 배경 밝기가 어긋난 상태입니다.
검사기 없이는 둘이 사실상 같습니다. 여기서 모델을 고를 이유는 없어요.
검사기를 주면 둘 다 90점을 넘긴다
2차 실행에선 부를 때마다 화면을 찍어 점수와 차이 그림을 돌려주는 검사기를 함께 넘겼습니다. 90을 넘기면 종료, 열두 번 검사하고도 안 되면 중단하는 조건이었어요.
오퍼스는 90.6점, 소넷은 90.2점. 둘 다 15점가량 올랐습니다. 점수만 보면 결론은 "둘 다 된다"예요.
다른 것은 90점까지 간 길이다
| 검사기를 준 실행 | 오퍼스 5.5 | 소넷 5.5 |
|---|---|---|
| 확인 횟수 | 3번 | 9번 |
| 걸린 시간 | 4분 7초 | 20분 33초 |
| 대화 주고받기 | 21턴 | 40턴 |
| 요금 환산 | 약 71센트 | 약 77센트 |
시간은 다섯 배, 확인은 세 배인데 요금은 거의 같습니다. 표에서 이상한 건 마지막 줄이에요.
단가가 절반인데 요금이 비슷한 이유
2026년 9월 29일 공시 단가로 소넷 5.5는 백만 토큰당 입력 2달러·출력 10달러, 오퍼스 5.5는 4달러·20달러입니다. 정확히 절반이에요.
그런데 소넷은 같은 점수까지 대화를 거의 두 배 주고받았고, 그때마다 앞 내용을 다시 읽었습니다. 누적 입력 토큰이 오퍼스 46.4만 개, 소넷 148.7만 개로 약 3.2배였어요. 단가에서 아낀 몫을 양이 다시 채운 셈입니다.
그래서 반복 확인이 들어가는 일에서는 단가표가 아니라 끝까지 간 총액으로 비교해야 합니다.
처음 적은 소넷 요금은 틀린 숫자였다
실험 직후 원장에 적은 소넷 요금은 지금 숫자의 약 두 배였습니다. 당시 클로드 코드 명령 줄 도구가 소넷 5.5를 모르는 모델로 보고 오퍼스 단가로 계산했거든요. 실행 네 건을 공시 단가로 다시 계산해서 위 숫자로 고쳤습니다.
"싼 모델이 오히려 더 비쌌다"는 결론은 그 오류가 만든 것이었어요. 다시 계산해 보니 사실이 아니었다는 걸 알고 버렸습니다. 도구가 찍어 준 요금을 그대로 옮기기 전에 모델 이름과 단가가 맞게 잡혔는지 한 번 보세요.
오퍼스에 맡길 일, 소넷에 맡길 일
저는 이렇게 나눠 씁니다.
오퍼스 5.5가 나은 경우는 결과를 빨리 받아야 할 때, 확인 한 번이 오래 걸리는 일일 때, 중간에 사람이 지켜보며 기다려야 할 때입니다.
소넷 5.5가 나은 경우는 결과를 나중에 받아도 될 때, 확인 한 번이 짧게 끝나는 일일 때, 돌려 두고 다른 일을 해도 될 때입니다.
그래서 제 기본값은 급한 확인 반복은 오퍼스, 밤새 돌려도 되는 확인 반복은 소넷입니다. 이번 실험 하나에서 나온 운용안이라 현재로선 그렇다는 정도로 들어 주세요.
점수를 믿으면 부담이 되는 경우
오퍼스의 세 번 검사는 75.5 → 77.1 → 90.6이었습니다. 마지막 한 번에 오른 13.5점은 흐름도가 아니라 배경 격자무늬를 원본 간격대로 다시 그린 데서 왔어요. 바탕색과 다르면 무엇이든 내용으로 치는 채점이라 생긴 구멍입니다.
소넷의 통과선 여유는 0.2점뿐이었고, 손글씨 메모는 끝내 시스템 서체로 남았습니다. 합격 점수와 눈에 보이는 차이가 한 화면에 같이 있었던 거죠.
모델과 상관없이 저는 검사 항목 옆에 '채점이 보지 않는 곳'을 최대 세 군데 적습니다. 이번 과제였다면 손글씨 서체와 메모 위치요.
검사기를 줄 일과 캡처로 충분한 일
비교할 원본이 있고 같은 일을 여러 번 반복한다면 점수를 내는 검사기를 줄 만합니다. 클로드 코드에서 크롬을 붙여 쓰고 있다면 '만든 화면을 열어 원본 옆에 두고 봐 줘'라고 적는 것만으로도 됩니다.
채팅창에서 한 번 하는 일이라면 결과를 캡처해서 원본과 나란히 붙이고 비교를 시키는 것으로 충분합니다. 아무것도 열어 볼 수 없으면 검사기 없는 소넷이 그랬듯 '열어 보지도, 비교하지도 못했다'는 보고를 받게 됩니다.
규칙 파일은 모델과 따로 따진다
같은 날 저희 규칙 묶음(CLAUDE.md 같은 안내 파일과 스킬)을 붙인 경우와 뺀 경우로 60초 대본을 맡겨 봤습니다. 붙인 쪽 두 모델 모두 그 문서를 열어 보지 않았고, 결과물 품질에도 차이가 없었어요. 호출마다 1.3만 토큰가량이 앞에 얹히는 비용만 생겼습니다.
모델을 바꾸는 것보다 이쪽이 더 싼 결정입니다. 규칙은 일단 비워 보고, 똑같은 실수가 다시 나오면 그 한 줄만 돌려놓으세요. 클로드 코드 문서의 기준도 똑같이 두 번째 실수예요.
이 비교에도 한계선이 있다
모든 조건을 한 차례씩만 실행했습니다. 소넷이 다음 번엔 확인 5번에 끝날 수도 있어요. 그래서 이 글의 판정은 "점수로는 못 가른다"까지만 강하게 말하고, 시간 다섯 배는 경향으로만 말합니다.
점수 자체도 제가 만든 척도라 사람 눈 판정이 아니에요. 확인 반복이 짧은 일에서는 두 모델의 시간 차이가 훨씬 작을 수 있습니다.
정리
75점에서 90점으로 끌어올린 건 모델이 아니라 확인할 도구였고, 두 모델의 차이는 90점 뒤의 확인 횟수와 시간에서만 보였습니다. 90점짜리 화면에도 사람이 고쳐야 할 손글씨가 있었고요.
다음에 모델을 고를 땐 점수표 대신 "얼마나 빨리 받아야 하나"와 "검사기가 무엇을 못 보나" 두 가지를 먼저 적어 보세요. 실험 과정은 9분 14초 영상에 있고, 검사기 파일과 네 줄짜리 업무 틀은 오픈채팅방 방구석모각코 공지에 있어요.



