AI트렌드

새 Sonnet이 나왔다고 바로 갈아타지 마세요 — Claude Sonnet 5.5, Sonnet 5·Opus 5.5와 무엇이 다른가

Kyle Choi · 2026년 9월 29일

어두운 청록빛 공간에 비스듬히 내려오는 빛줄기 속에 끌 한 자루가 떠 있고, 새로 벼린 날만 차갑게 빛난다

2026년 9월 28일(미국 발표 기준), Anthropic이 Claude Sonnet 5.5를 공개했습니다. 발표문은 Sonnet 5보다 30% 이상 빠르고, 대부분의 작업에서 최대 30% 낮은 비용으로 쓸 수 있다고 설명합니다. 여기서 가격표의 토큰 단가와 작업 하나를 끝내는 비용은 구분해야 합니다. Sonnet 5.5의 입력·출력 토큰 가격은 Sonnet 5와 같지만, 같은 일을 할 때 더 적은 토큰을 쓰는 경우가 많다는 것이 회사의 설명입니다.12

이 글은 Sonnet 5.5를 이전 모델인 Sonnet 5, 같은 Claude 5.5 계열의 Opus 5.5와 나란히 살펴봅니다. 성능 수치는 Anthropic이 발표한 평가와 발표 페이지에 실린 고객사 인용입니다. 우리 환경에서도 두 모델에 같은 과제를 맡긴 비교 실험은 하지 않았으므로, 발표 내용과 작업 환경 실측을 나눠 읽겠습니다.

1. 세 줄 요약

  • Sonnet 5.5는 Anthropic 발표 기준 Sonnet 5보다 30% 이상 빠르고, 자체 시험에서 작업당 비용이 최대 30% 낮습니다. 입력·출력 토큰 단가는 Sonnet 5와 같습니다.12
  • Anthropic은 범위가 분명한 일상 업무, 버그 수정, 문서·슬라이드·스프레드시트 작성에는 Sonnet 5.5를, 세심한 판단이 필요한 복잡한 작업에는 Opus 5.5를 앞세웁니다.1
  • Sonnet 5에서 이미 돌아가던 코드에 영향을 주는 변경이 다섯 가지 있습니다. 새 모델이 나왔다고 이름만 바꾸기 전에 설정부터 확인해야 합니다.13

2. Sonnet 5.5 · Sonnet 5 · Opus 5.5 비교

항목 Claude Sonnet 5.5 Claude Sonnet 5 Claude Opus 5.5
발표일 2026년 9월 28일(미국 발표 기준)1 2026년 6월 30일2 2026년 9월 22일4
Anthropic이 설명한 역할 범위가 분명한 일상 업무, 버그 수정, 다듬어진 문서·슬라이드·스프레드시트 작성에 강점1 Sonnet 5.5 발표에서 비교 기준으로 언급 세심한 판단이 필요한 복잡한 작업에 적합1
속도·작업 비용 Sonnet 5보다 30% 이상 빠름. 자체 시험에서 작업당 비용 최대 30% 절감1 Sonnet 5.5 발표의 비교 기준 Sonnet 5.5와 같은 기준으로 비교한 수치는 확인 안 됨
API 입력·출력 단가(토큰 100만 개당) $2 / $10. 캐시 읽기는 $0.201 $2 / $10. 이 가격이 영구화됐다고 발표2 $4 / $20. Opus 5보다 20% 낮다고 발표4
문맥 창·최대 출력 100만 토큰 · 최대 출력 12만 8천 토큰5 확인 안 됨 확인 안 됨
API 모델 ID claude-sonnet-5-53 확인 안 됨 확인 안 됨
응답 속도 · 사고 방식(문서 비교표 표기) Fast · Adaptive5 확인 안 됨 Moderate · Adaptive (always on)5
이용 경로 Anthropic은 AWS, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 이용 가능하다고 발표1 확인 안 됨 확인 안 됨

발표일은 각 회사가 표기한 날짜를 옮겼습니다. Sonnet 5.5는 공식 페이지와 문서에 9월 28일로 적혀 있지만, 한국시간 날짜는 확인 안 됐습니다. 그래서 이 글에서는 날짜 뒤에 미국 발표 기준이라고 표시합니다.15

표에서 확인 안 됨이라고 쓴 칸은 모델이 해당 기능을 지원하지 않는다는 뜻이 아닙니다. 이번에 비교한 공식 자료에서 Sonnet 5와 Opus 5.5의 문맥 창·최대 출력·모델 ID·이용 경로를 확인하지 못했다는 뜻입니다. 빈칸을 기억이나 다른 자료로 채우지 않고, 현재 확인된 차이만 표에 남겼습니다.

3. 점수는 과제와 조건을 함께 봐야 한다

Anthropic은 Sonnet 5.5가 에이전틱 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록했고, Sonnet 5는 10.3%였다고 밝혔습니다. 같은 평가에서 Opus 5.5는 66.4%로 제시돼 있습니다.1

평가 Sonnet 5.5 Sonnet 5 Opus 5.5
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹
CursorBench 4.0 55.5% 34.1% 57.8%²

¹ Anthropic은 Opus 5.5의 Terminal-Bench 4.0 결과를 Xhigh effort에서 얻은 모델의 최고 점수로 보고했다고 밝혔습니다. effort는 모델이 답을 내기 전에 추론에 들이는 정도를 고르는 설정으로, 발표 자료의 그래프에는 Low·Med(Medium)·High·Xhigh·Max 단계가 표시돼 있습니다. 따라서 이 행만 보고 “Sonnet이 Opus보다 낫다”고 일반화할 수 없습니다. Anthropic은 벤치마크가 모델 능력의 한 면만 포착하며, 복잡하고 개방형인 작업에서 지속적인 판단이 필요한 경우 Opus 5.5가 여전히 분명히 강하다고 덧붙였습니다.1

² CursorBench 4.0의 Sonnet 5.5 55.5%는 Anthropic 발표 페이지에 실린 고객사 인용에 포함된 수치입니다. 그 인용은 Opus 5.5가 그 결과보다 높다고 설명합니다. 이 역시 특정 벤치마크에서 나온 결과이지, 문서 작성·기획·분석을 포함한 모든 업무에서의 순위를 뜻하지는 않습니다.1

두 수치를 함께 놓는 목적은 승자를 고르는 것이 아니라, 공개 점수를 읽을 때 조건을 확인해야 한다는 점을 보여주는 데 있습니다. Terminal-Bench 4.0에서 Opus 5.5의 점수는 Xhigh effort 최고점으로 표기됐습니다. 반면 Anthropic의 설명은 Max effort에서 여러 평가의 Sonnet 5.5가 Opus 5.5와 비슷한 성능을 보이기도 한다고 말하면서, 복잡하고 개방형인 일에서는 Opus가 여전히 더 강하다고 선을 긋습니다. 서로 다른 effort 설정의 숫자를 단순히 빼거나 더해 전체 모델의 우열로 바꾸지 않는 편이 정확합니다.1

Sonnet 5와 비교할 때도 발표 수치를 그대로 범위에 맞춰 읽어야 합니다. Anthropic은 Claude 앱의 기본값인 Medium effort에서 Sonnet 5.5가 Terminal-Bench 4.0에서 Sonnet 5의 최고 점수를 크게 웃돌며, 작업당 비용은 10분의 1보다 낮다고 밝혔습니다. 이 문장은 해당 평가와 설정에 관한 회사 발표입니다. 모든 일상 업무에서 비용이 항상 10분의 1이라는 뜻은 아닙니다.1

Anthropic 발표 페이지에는 고객사 평가도 함께 실렸습니다. CodeRabbit은 Sonnet 5에서 자주 웹 검색을 선택하고 토큰을 많이 쓰던 경향이 새 모델에서는 사라졌다고 말했습니다. SpaceXAI는 자사 CursorBench 4.0 결과로 55.5%를 들며 Opus 5.5 다음이라고 설명했습니다. Base44는 실제 앱 제작 118건에서 Sonnet 5.5 결과가 Opus 5와 비슷한 수준이었다고 전했습니다. Unity는 자사의 여러 단계 Unity Editor·코딩 평가에서 과제의 90%를 완료했다고 밝혔습니다.1

이 내용은 Anthropic 발표 페이지에 실린 고객사 인용입니다. 고객사가 각자 설명한 평가나 경험을 보여주지만, 서로 같은 과제와 설정을 사용한 하나의 맞대결 시험은 아닙니다. Base44의 비교 대상은 Opus 5이고, CursorBench와 Unity 평가도 각 회사가 밝힌 자체 조건을 전제로 합니다. 그러므로 이런 인용은 특정 사용 맥락의 참고 사례로 읽고, 내 업무에서도 같은 결과가 나온다고 가정하지 않는 것이 좋습니다.1

4. 토큰 단가와 작업당 비용은 다르다

Sonnet 5.5의 API 입력 단가는 토큰 100만 개당 2달러, 출력 단가는 10달러입니다. 캐시 읽기 단가는 토큰 100만 개당 0.20달러입니다. 입력·출력 단가는 Sonnet 5와 동일하며, Anthropic은 Sonnet 5의 이 가격을 영구화했다고 밝혔습니다.152

그렇다면 “최대 30% 비용 절감”은 어디서 나올까요? 발표에 따르면 Sonnet 5.5는 같은 작업을 할 때 토큰을 훨씬 적게 쓰는 경우가 많고, Anthropic 자체 시험에서 이전 모델보다 작업당 최대 30% 낮은 비용을 보였습니다. 단가표가 내려간 것과 한 작업을 끝내기 위해 소비하는 토큰 수가 줄어드는 것은 서로 다른 변화입니다. 그래서 “토큰 단가는 그대로인데 작업 비용은 낮아질 수 있다”는 두 설명은 모순이 아닙니다.1

비교 대상인 Opus 5.5의 입력·출력 단가는 토큰 100만 개당 4달러와 20달러입니다. Anthropic은 이 가격이 Opus 5보다 20% 낮다고 안내했습니다. 다만 이번에 확인한 자료에는 Opus 5.5와 Sonnet 5.5의 작업당 비용을 같은 과제와 같은 설정으로 비교한 수치가 없습니다. 단가 차이만으로 작업 하나의 총비용이나 결과 품질까지 계산할 수는 없습니다.4

속도 주장도 같은 방식으로 한정해야 합니다. “30% 이상 빠르다”는 Sonnet 5.5와 Sonnet 5 사이의 Anthropic 발표입니다. 이를 Opus 5.5보다 30% 빠르다는 뜻으로 옮기거나, 모든 입력과 출력에서 같은 속도 차이가 난다고 확장하면 근거 범위를 벗어납니다.1

5. 문맥 창, 출력 길이, 이용 경로

공식 문서는 Sonnet 5.5의 문맥 창을 100만 토큰, 최대 출력을 12만 8천 토큰으로 각각 표기합니다.5

API에서 선택할 이름은 claude-sonnet-5-5입니다. Anthropic은 Sonnet 5.5가 AWS, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 제공된다고 발표했습니다.13

추론 effort 기본값은 제품 경로에 따라 다릅니다. Anthropic은 Claude Code와 자사 앱에서는 Medium, Claude Platform에서는 High가 기본이라고 안내했습니다. 벤치마크 결과를 다른 실행과 비교하려면 모델 이름만 맞출 것이 아니라 effort 설정도 함께 확인해야 합니다. 앞서 본 Terminal-Bench에서 Opus 5.5는 Xhigh 최고점으로 보고됐다는 점이 좋은 예입니다.1

이번에 확인한 공식 문서에는 Sonnet 5와 Opus 5.5의 문맥 창·최대 출력이 실려 있지 않습니다. 따라서 “세 모델 중 누가 가장 긴 문맥을 처리한다”거나 “Opus가 Sonnet보다 더 긴 답을 만든다”는 비교는 여기서 확인할 수 없습니다. 확인된 100만 토큰과 12만 8천 토큰은 Sonnet 5.5의 공식 문서 값으로만 제시합니다.5

6. 옮기기 전에 확인할 것

새 모델이 나오면 설정 파일의 모델 이름만 바꾸고 싶어집니다. 그런데 Anthropic 문서는 Sonnet 5에서 이미 돌아가는 코드에 영향을 주는 변경이 다섯 가지 있다고 밝힙니다. 그중 실무자가 먼저 알아 둘 만한 것을 추렸습니다.3

  • 생각(thinking)을 끄고 쓰던 경우: thinking: {"type": "disabled"}로 보내는 요청은 400 오류가 납니다. Anthropic은 thinking을 끄고 Sonnet을 쓰던 사용자라면 옮기기 전에 새 설정인 between_tools로 바꿔야 한다고 안내합니다. 이 설정은 답하기 전에 먼저 생각하는 단계를 끈 상태를 유지합니다.13
  • temperature 같은 값을 직접 정해 쓰던 경우: temperature, top_p, top_k를 기본값이 아닌 값으로 보내면 400 오류가 납니다.5
  • 나머지 변경: 도구 사용을 강제하는 요청이 오류를 내고, 생각 블록이 모델과 대화에 묶이며, Claude API와 Google Cloud에서 이전 컴퓨터 사용 도구(computer_20251124)를 받지 않고, advisor 도구가 Claude Opus 4.8·Opus 4.7·Sonnet 5를 조언 모델로 받지 않습니다. API를 직접 호출하는 도구를 쓰고 있다면 공식 문서의 해당 항목을 확인해야 합니다.3

반대로 그대로인 것도 있습니다. 토크나이저가 Sonnet 5와 같아서 같은 글은 같은 토큰 수로 계산됩니다. 공식 문서에는 Sonnet 5.5의 퇴역 시점이 「2027년 9월 28일보다 이르지 않다」고 적혀 있습니다.53

보안 관련 제한도 하나 있습니다. Anthropic은 Sonnet 5.5의 사이버보안 능력이 크게 올라 Opus 5.5와 비슷한 보호 장치를 붙였다고 설명합니다. 코드의 버그를 찾고 고치는 일상 작업은 그대로 할 수 있지만, 위험도가 높은 사이버보안 작업은 눈에 보이게 Sonnet 5로 넘어갑니다.1

가볍고 양이 많은 작업을 위한 Claude Haiku 5.5는 몇 주 안에 같은 5.5 계열에 합류할 예정이라고 발표됐습니다. 비용이 가장 중요한 반복 작업이라면 이 모델도 선택지로 기억해 둘 만합니다.1

7. 우리 작업 환경에서 확인한 내용

9월 29일 저녁(한국시간), Claude Code를 새 버전으로 올리면서 여러 에이전트가 역할을 나눠 일하는 작업 환경을 전부 다시 시작했습니다. 이때 총괄 역할은 Opus 5.5에 두고, 실무·보조 역할만 Sonnet 5.5로 바꿨습니다. 따라서 이 환경을 “모든 역할을 Sonnet 5.5로 바꾼 사례”로 설명하면 정확하지 않습니다.

claude-sonnet-5-5라는 모델 ID는 Claude Code 2.1.284에서 인식됐습니다. 이 확인은 새 이름이 해당 작업 환경에서 감지됐다는 사실에 관한 것입니다. 같은 과제를 두 모델에 맡겨 결과를 채점한 실험은 아니므로, 이 설정 경험만으로 Sonnet 5.5의 품질이 Opus 5.5보다 높거나 낮다고 판단할 수는 없습니다.

문맥 표시에서는 한 가지 차이가 있었습니다. 공식 문서상 Sonnet 5.5는 100만 토큰 문맥 창을 지원하지만, 우리 환경에서는 100만 옵션을 붙여 실행해도 표시가 기본 창으로 나왔습니다. 같은 방식으로 실행한 Opus 5.5에서는 100만 표시가 보였습니다. 새로 실행한 Sonnet 5.5 환경 여러 곳에서 같은 표시를 확인했으며, 그 원인은 아직 확인 중입니다.5

이 관찰을 “Sonnet 5.5는 100만 토큰을 지원하지 않는다”는 뜻으로 읽어서는 안 됩니다. 확인된 것은 공식 문서의 지원 표기와 우리 환경의 상태 표시가 달랐다는 점입니다. 표시 차이가 실제 사용 한도와 어떤 관계인지, 계정이나 설정 등 어떤 요인이 영향을 주었는지는 이번 실측만으로 알 수 없습니다. 그래서 지원 여부와 상태 표시, 원인 확인을 각각 구분해 두었습니다.

8. 비개발 실무자는 어떻게 고를까

Anthropic의 용도 설명을 기준으로 보면, 범위와 결과물이 비교적 분명한 일상 업무는 Sonnet 5.5부터 살펴볼 후보입니다. 발표문은 버그 수정 외에도 다듬어진 문서, 슬라이드, 스프레드시트 작성을 구체적으로 들었습니다. 개발자가 아니더라도 문서 초안이나 자료를 정리하는 일을 맡길 때 이 설명을 참고할 수 있습니다. 다만 이는 Anthropic이 밝힌 강점이지, 한국어 문서 품질을 같은 조건에서 직접 비교한 결과는 아닙니다.1

반대로 질문 자체가 열려 있고, 여러 갈래를 검토하면서 세심한 판단을 오래 이어가야 한다면 Anthropic은 Opus 5.5를 그쪽에 배치합니다. 모델을 고를 때 “더 비싼 모델이 항상 낫다”거나 “점수가 높은 모델이 모든 일에 적합하다”고 정하기보다, 지금 맡길 일이 범위가 잘 정해진 반복 작업인지, 아니면 판단 기준을 세우며 탐색해야 하는 복잡한 일인지 먼저 살펴볼 수 있습니다. 이는 발표된 역할 구분을 실무자가 읽기 쉽게 옮긴 기준입니다.1

비용을 먼저 본다면 입력·출력 토큰의 표시 가격과 작업당 비용을 따로 비교해야 합니다. Sonnet 5.5의 입력·출력 토큰 가격은 Sonnet 5와 같고 Opus 5.5보다 낮지만, 실제 작업당 비용을 두 모델 사이에서 직접 비교한 수치는 이번 자료에서 확인 안 됐습니다. Anthropic이 밝힌 최대 30% 절감은 Sonnet 5와 비교한 자체 시험 결과입니다. 따라서 예산표에는 확인된 단가를 적고, 업무에서의 총비용은 실제로 맡길 과제와 설정에 대한 별도 확인이 필요하다고 보는 편이 정확합니다.1524

긴 자료를 다루는 경우 Sonnet 5.5의 공식 문서상 문맥 창은 100만 토큰입니다. 하지만 Opus 5.5와 Sonnet 5의 문맥 한도는 이번에 확인한 공식 문서에서 확인 안 돼 세 모델을 길이 기준으로 비교할 수는 없습니다. 또한 우리 작업 환경에서는 Sonnet의 100만 표시가 나타나지 않은 사례가 있었으므로, 문서상 한도와 실제 제품 화면의 표기를 모두 확인해야 할 수 있습니다. 표시가 다르게 나온 이유는 확인되지 않았습니다.5

결국 첫 선택은 과제의 모양으로 정할 수 있습니다. 범위가 좁고 산출물이 분명한 일은 Sonnet 5.5를 먼저 시험해 볼 수 있고, 복잡하고 개방형인 판단 작업은 Opus 5.5를 후보로 놓을 수 있습니다. 그 선택은 발표 내용을 업무에 적용한 시작점이지, 두 모델의 전체 순위를 정하는 결론은 아닙니다. Anthropic의 벤치마크 설명 자체도 점수 하나로 모델의 모든 능력을 대표할 수 없다고 말합니다.1

9. 정리

Claude Sonnet 5.5의 눈에 띄는 변화는 Sonnet 5보다 빠르다는 발표, 동일한 토큰 단가에서 토큰 사용량을 줄여 작업당 비용을 낮췄다는 주장, 그리고 범위가 분명한 일상 업무를 겨냥한 포지셔닝입니다. 공식 문서에는 문맥 창 100만 토큰, 최대 출력 12만 8천 토큰, API 모델 ID claude-sonnet-5-5가 나옵니다.153

Opus 5.5와의 관계는 벤치마크 한 행으로 정리되지 않습니다. 특정 평가에서 Sonnet 5.5가 높은 수치를 냈더라도, Opus 5.5의 결과는 다른 effort 조건일 수 있고 Anthropic은 복잡하고 개방형인 지속적 판단 업무에서 Opus가 강하다고 설명합니다. 범위가 분명한 일상 업무는 Sonnet 5.5, 신중한 판단이 필요한 복잡한 작업은 Opus 5.5라는 회사의 역할 구분을 출발점으로 삼되, 우리 환경에서 확인한 설정 표시와 실제 결과는 따로 확인해야 합니다.1

Footnotes

  1. Anthropic, Claude Sonnet 5.5 발표 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32

  2. Anthropic, Claude Sonnet 5 발표 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  3. Anthropic, Claude Sonnet 5.5 변경 사항 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8

  4. Anthropic, Claude Opus 5.5 발표 ↩ ↩2 ↩3 ↩4

  5. Anthropic, Claude Sonnet 5.5 모델 개요 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13