Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
코딩과 쓰기: 최고의 Claude 모델 선택 가이드
2026/07/27

코딩과 쓰기: 최고의 Claude 모델 선택 가이드

Claude 모델별 코딩 벤치마크 비교: Fable 5는 SWE-Bench Pro 1위이지만 Opus 5는 터미널 작업과 지식 작업에서 우수하고 가격은 3분의 1입니다.

코딩에 최고인 Claude 모델이 무엇인지는 어느 기준으로 보느냐에 따라 답이 달라집니다. 벤치마크 점수가 최고인 모델도 있고, 달러당 성능이 최고인 모델도 있고, 새벽 2시에 깜짝 놀라게 하지 않을 모델도 따로 있습니다.

공개된 수치만으로도 많은 부분이 결정되는데, Anthropic 자신의 테이블에서 자기들 플래그십 모델이 지는 행까지도 있습니다.

TL;DR

  • 가장 높은 에이전트 코딩 점수: Claude Fable 5는 SWE-Bench Pro에서 80.3%[1].
  • 대부분 팀의 기본 선택: Claude Opus 5. Anthropic은 복잡한 에이전트 코딩과 엔터프라이즈 작업용으로 포지셔닝합니다[2].
  • Opus 5가 지는 코딩 행 하나: GPT-5.6 Sol이 DeepSWE v1.1에서 68.8% Opus 5를 꺾고 72.7%[3].
  • 쓰기 작업에서 순위 역전, 지식 작업 분야에서는 Opus 5가 GDPval-AA v2에서 1861 점으로 우위[3].
  • 노력 수준이 모델 선택보다 더 중요: Opus 5의 lowmedium 설정이 예상 외로 우수한 품질 유지[2].
  • reAPI에서는 Opus 5가 Fable 5보다 훨씬 저렴하므로 선택이 바뀝니다.

코딩 벤치마크 수치

세 가지 코딩 벤치마크별 세 명의 우승자: SWE-Bench Pro는 Fable 5, Frontier-Bench는 Opus 5, DeepSWE는 GPT-5.6 Sol, 그리고 순위가 역전되는 지식 작업 행

세 모델이 진정한 경쟁 관계입니다. Anthropic이 공개한 각 모델의 수치입니다.

벤치마크Fable 5Opus 5Opus 4.8
SWE-Bench Pro (에이전트 코딩)80.3%n/a69.2%
FrontierCode Diamond (가장 어려운 코딩)29.3%53.4%†13.4%
Terminal-Bench 2.188.0%*n/a82.7%
Frontier-Bench v0.1 (에이전트 터미널)33.7%43.3%21.1%
DeepSWE v1.1 (에이전트 코딩)69.7%68.8%59.0%

* 별 기호가 있는 행은 공개된 Fable 5가 제한 없는 형제 모델과 다른 이유를 Anthropic이 명시한 부분입니다. 안전 분류기가 작동해서 실제 호출 가능한 모델은 이 수치보다 Opus 4.8에 가까울 것으로 예상됩니다[1]. † FrontierCode v1.1 Main은 Fable 5 열의 Diamond 부분 집합과 다른 벤치마크 버전입니다. 열 방향으로 읽으세요.

그 테이블에서 두 가지 결론이 나옵니다.

Fable 5는 직접 비교 가능한 코딩 벤치마크에서 상위권에 있으며 SWE-Bench Pro에서는 실질적 간격이 있습니다[1].

Opus 5는 새로운 에이전트-터미널 벤치마크에서 결정적으로 우승합니다. Opus 4.8의 Frontier-Bench 점수를 2배 이상 초과합니다[3].

Anthropic이 남긴 그 행

DeepSWE v1.1에서 Anthropic 자신의 비교 테이블은 GPT-5.6 Sol을 72.7%로 Opus 5의 68.8%를 꺾고 있습니다[3]. 이것이 보드 전체에서 가장 명확한 코딩 손실이며 정확히 Opus 5가 마케팅하는 워크로드에 해당합니다.

이를 무시하기보다는 진지하게 받아들일 가치가 있습니다. 평가가 DeepSWE와 비슷하다면 경쟁사가 벤더 자신의 수치로 더 높은 점수를 냅니다. 장기간 터미널 작업과 비슷하다면 Opus 5가 같은 테이블에서 경쟁사보다 9점 더 높습니다.

교훈은 한 모델이 더 낫다는 것이 아닙니다. "코딩에 최고"는 어느 코딩 벤치마크가 작업과 일치하느냐에 따라 해석이 달라진다는 것입니다.

쓰기에는 어떤 모델

쓰기 질문을 던지면 순위가 재편성됩니다. 쓰기는 코드보다 지식 작업에 더 가깝기 때문입니다.

벤치마크Opus 5Fable 5Opus 4.8
GDPval-AA v2 (지식 작업, Elo)186117471593
Humanity's Last Exam, 도구 없음56.3%56.5%49.8%
Humanity's Last Exam, 도구 포함64.7%63.9%57.9%

Opus 5는 지식 작업에서 Fable 5보다 Elo 114점 앞서갑니다[3]. 도구 없는 추론에서는 두 모델이 통계적으로 동등합니다.

초안 작성, 편집, 합성에는 이 GDPval 격차가 관련 신호이며 코딩 벤치마크 우승자보다는 Opus 5를 가리킵니다.

모델 선택을 이기는 변수

한계 이하에서는 노력 수준이 모델 전환보다 결과를 더 크게 움직입니다.

Anthropic은 Opus 5가 이전 Opus 모델보다 추가 노력을 더 안정적으로 더 나은 결과로 변환한다고 설명하고, 따로 lowmedium이 토큰과 지연 시간의 분수로 강력한 품질을 생산한다고 언급합니다[2]. 공식 지침은 기본값 high에서 시작하고 자체 평가에 따라 양방향으로 스윕하는 것입니다.

이것은 이 전체 질문에 실질적 결과를 낳습니다. "최고" 모델을 선택하고 노력을 상속된 기본값으로 두는 팀은 종종 한 등급 아래이면서 다이얼을 튜닝한 팀보다 더 나쁜 결과를 더 느리게 얻습니다.

reAPI에서의 비용

모델 선택은 능력만큼 비용 결정입니다.

모델백만 토큰당 입력 / 출력
Claude Fable 5$8.00 / $40.00
Claude Opus 5$2.40 / $12.00
Claude Opus 4.8$4.00 / $20.00
Claude Sonnet 4.6$2.40 / $12.00

Fable 5는 같은 게이트웨이에서 Opus 5보다 3배 이상 비쌉니다. 이것이 코딩 질문을 다시 프레이밍합니다. Fable 5의 SWE-Bench Pro 우위는 실제이지만 같은 비용의 3배를 지불하고 있으며, 이 모델은 또한 필수 30일 데이터 보유 및 Opus 5에 없는 거부 레이어를 갖습니다[1].

대부분 팀에는 이 거래가 맞지 않습니다. 실패한 실행이 토큰보다 많은 비용이 드는 저장소 규모 마이그레이션에서는 가능합니다.

선택

기본값은 Opus 5로. 최고의 지식 작업 점수, 새로운 에이전트-터미널 벤치마크에서 결정적 우위, 이 게이트웨이에서 세 모델 중 가장 저렴합니다.

Fable 5를 찾으세요 작업이 장기간이고 어려울 때 그리고 자신의 작업에서 우위를 측정했을 때. FrontierCode 곡선이 정직한 주장입니다. 가장 어려운 문제에서 추가 노력은 다른 모델이 평탄화되는 곳에서도 정확도를 계속 구입합니다[1].

Opus 4.8에 머물러 평가가 이미 이것으로 보정되었거나 높은 노력 수준에서 생각을 비활성화해야 할 때. Opus 5는 이를 거부합니다[2].

Claude가 아닌 모델 고려 워크로드가 DeepSWE처럼 보일 때. 벤더 자신의 테이블이 그렇게 말합니다.

from openai import OpenAI

client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

하나의 키에서 모델 문자열을 바꾸면 됩니다. 요율은 reapi.ai/models에 있습니다.

FAQ

코딩에 최고인 Claude 모델은 무엇입니까?

Fable 5는 직접 비교 가능한 코딩 벤치마크에서 상위권이며 특히 SWE-Bench Pro에서 80.3%입니다[1]. Opus 5는 새로운 에이전트-터미널 벤치마크에서 우승하고 훨씬 저렴해서 대부분 팀에 더 나은 기본값입니다[3].

쓰기에 최고인 Claude 모델은 무엇입니까?

Opus 5. GDPval-AA v2 지식 작업에서 1861 Elo로 우승하며 Fable 5보다 114 앞서갑니다[3].

Claude는 코딩에서 GPT를 이깁니까?

모든 벤치마크에서는 아닙니다. Anthropic 자신의 테이블은 GPT-5.6 Sol이 DeepSWE v1.1에서 72.7%로 Opus 5의 68.8%를 꺾고 있는 반면 Opus 5는 같은 테이블의 에이전트 터미널 작업에서 우승합니다[3].

Fable 5가 3배 가격이 가치합니까?

작업이 어려워서 노력 곡선이 대가를 치를 때만. 또한 Opus 5에 없는 필수 30일 데이터 보유 및 분류기 거부 레이어를 갖습니다[1].

노력 수준이 모델 선택보다 더 중요합니까?

한계 이하에서는 종종 그렇습니다. Opus 5는 이전 Opus 모델보다 추가 노력을 더 안정적으로 결과로 변환하며 lowmedium 설정도 좋습니다[2].

특별히 코드 리뷰에는 어느 모델을 사용해야 합니까?

Opus 5, 한 가지 주의사항 제외. Anthropic 지침에 따르면 심각도 필터를 문자 그대로 따르므로 높은 심각도 문제만 요청하면 보고를 억압합니다. 신뢰도 레이블과 함께 모든 것을 요청하고 다운스트림에서 필터링하세요[2].

Sonnet은 코딩에 충분합니까?

비용 회전이 지배하는 높은 볼륨 작업의 경우 종종 그렇습니다. reAPI에서 Sonnet 4.6은 Opus 5와 같은 비용이므로 이것을 선택할 가격 주장을 없앱니다.

모델 간에 어떻게 전환합니까?

게이트웨이를 통해 호출하는 경우 한 키에서 모델 문자열 하나만 변경하면 됩니다.

벤치마크를 작업과 맞춰서 선택

코딩에 최고인 Claude 모델이 무엇인지에 대한 정직한 답변은 질문이 불충분하게 지정되었다는 것입니다. Fable 5는 기본 코딩 벤치마크에서 상위권입니다. Opus 5는 새로운 에이전트-터미널 벤치마크에서 상위권이고, 지식 작업에서 확실히 우위이고, 3분의 1 가격입니다. 경쟁사는 Anthropic이 어차피 공개한 한 행에서 둘 다를 이깁니다.

따라서 실제 작업과 가장 유사한 벤치마크를 선택하고 그 행을 읽으세요. 그리고 모델을 전환하기 전에 이미 사용 중인 모델에서 노력 다이얼을 스윕하세요. 한계 이하에서는 모델명보다 훨씬 더 많은 결과가 변합니다.

References

  1. reAPI. How to use Claude Fable 5 — benchmark table, effort curve, refusal layer, and retention. reapi.ai/blog/how-to-use-claude-fable-5
  2. Anthropic. What's new in Claude Opus 5 — effort guidance, behavior changes, and capability improvements. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. reAPI. How to use Claude Opus 5 — the full published benchmark table. reapi.ai/blog/how-to-use-claude-opus-5

Further reading