Model 변경
더 높은 지능의 모델 선택
- AI의 기본 지능과 풀 수 있는 문제의 범위를 정합니다.
- 지능이 높은 AI는 적은 노력으로도 더 좋은 답을 낼 수 있습니다.
60분 세미나 · 공개 자료 및 직접 실행
최근 AI 사용 방식을 조사하고 직접 시험하여 우리 업무에 적용할 수 있는지 검토합니다.
검토 항목: 완료 조건, 작업 시간, 크레딧 사용량
가장 가까운 금액을 맞힌 분께 상품을 드립니다.
츄라이 츄라이
기존의 일반적인 선택 방식
model과 effort를 항상 함께 높이지 않고, 작업에 맞게 각각 조절합니다.
여기서 드는 의문
엥? 좋은 모델이 오래 생각해야 문제를 잘 푸는 건 당연한 거 아님?
좋은 모델을 LOW로? 나쁜 모델을 MAX로? 왜?
Model × Effort
더 높은 지능의 모델 선택
같은 모델을 더 생각시키기
둘 다 높이면 비용도 커집니다.
어떤 조합이 합리적일까?
모델과 effort별 점수·비용 비교
AI 코딩 제품 개발사 Cognition의 자체 평가 · 왼쪽일수록 비용이 낮습니다.
FrontierCode 1.1 Main 원문 ↗ · 주요 7개 모델의 원본 그래프 · 2026. 9. 6. 캡처 · 이미지를 누르면 확대됩니다.
비용 절감률 = (High 비용 − 비교 설정 비용) ÷ High 비용 × 100 · 작업 1회당 평균 비용 · 원문 표의 표시값으로 계산
모델과 effort별 점수·비용 비교
AI 코딩 제품 개발사 Cursor의 자체 평가 · 오른쪽일수록 비용이 낮습니다.
CursorBench 3.2 원문 ↗ · Fable 5.1 등 주요 모델의 원본 그래프 · 2026. 9. 6. 캡처 · 이미지를 누르면 확대됩니다.
비용 절감률 = (High 비용 − 비교 설정 비용) ÷ High 비용 × 100 · 공개 API 단가 기준 · Luna는 Cursor 환경에서 평가한 결과
그래도 궁금한 건
나는 벤치마크
안 믿어!
점수만 좋고,
써보면 별로 아냐?
공개 반응 · 2026년 9월 4일 확인
정확한 설정명을 직접 언급한 검색 표본은 106건이며, 이 가운데 67건이 긍정적이었습니다. 추천 이유가 구체적인 의견을 10건씩 골랐습니다.
긍정 29 · 중립·혼합 14 · 부정 6
이전 플래그십급 지능을 약 13분의 1 토큰 단가로 제공한다고 평가했습니다.
원문 ↗
Fable보다 시각 복제는 약했지만 의도 파악과 사용성은 더 좋았다고 평가했습니다.
원문 ↗
GPT-5.5 xhigh와 비슷한 점수를 훨씬 낮은 비용에 제공한다고 소개했습니다.
원문 ↗
정형 구현을 Luna max에 맡기는 공개 워크플로를 제안했습니다.
원문 ↗
숨은 버그 105개 중 33개를 수정했으며 API 환산 비용은 1.80달러였다고 보고했습니다.
원문 ↗
프런트엔드를 제외하면 코딩 품질이 좋고 비용도 낮다고 평가했습니다.
원문 ↗
범위가 명확한 구현에서 지능과 비용의 균형이 좋다고 평가했습니다.
원문 ↗
크레딧 소모가 작고 코드 품질도 기대보다 좋았다고 평가했습니다.
원문 ↗
느리고 오류도 있지만 대부분의 작업에 계속 사용한다고 밝혔습니다.
원문 ↗
DeepSWE에서 GPT-5.5 xhigh와 같은 통과율을 약 12분의 1 비용으로 기록했다고 해석했습니다.
원문 ↗긍정 38 · 중립·혼합 11 · 부정 8
Fable 5.1 low를 먼저 시험하라고 권고했습니다.
원문 ↗
가장 낮은 effort부터 시작해도 대부분 충분하다고 권고했습니다.
원문 ↗
low가 영리하고 Opus보다 저렴하다고 평가했습니다.
원문 ↗
effort별 결과를 비교하고 low의 효율과 품질을 높게 평가했습니다.
원문 ↗
Fable 5 low가 Opus 4.8 max와 대략 비슷하다고 평가했습니다.
원문 ↗
low도 충분히 유능하며 xhigh보다 빠르다고 평가했습니다.
원문 ↗
가격과 간결한 응답 방식이 인상적이라고 평가했습니다.
원문 ↗
Fable low가 다른 모델을 관리하도록 하면 사용량을 아낄 수 있다고 제안했습니다.
원문 ↗
자신의 코드에 low를 사용했고 결과에 만족했다고 밝혔습니다.
원문 ↗
high보다 사용량을 아끼는 일상 설정으로 추천했습니다.
원문 ↗2026년 9월 4일에 확인한 검색 표본이며, 웹 전체 게시물 수나 여론을 뜻하지 않습니다. * 공개 미러 표시값 ·
이제 우리 차례
우리 일에 맡겨도 괜찮을까?
분명 한계가 있을 텐데?
직접 실행
2026. 7. 30. API 가격 80% 인하 · Codex 크레딧 차감량도 인하 ↗
결과다양한 요구 사항을 단시간에 반영하여 명시적인 의사소통 기준으로 활용했습니다.
사용 비용$1.59
결과—
사용 비용—
결과—
사용 비용—
결과변환 결과에서 원문의 일부 내용이 누락되고 의미가 변질되었습니다.
실패 이유제공한 형식만으로는 각 내용을 어느 항목에 배치해야 하는지 명확하지 않았습니다.
사용 비용—
확인할 점원문의 내용과 의미를 유지하면서 요청한 문체로 바꾸는지 확인할 예정입니다.
결과실행 전 · 결과 미확인
사용 비용—
결과—
사용 비용—
직접 실행
결과연결된 티켓은 요구 사항 순서로 정렬했고, 연결이 불분명한 티켓은 차트 아래에 남겼습니다.
사용 비용—
결과—
사용 비용—
결과—
사용 비용—
결과—
사용 비용—
결과—
사용 비용—
결과—
사용 비용—
모델과 effort 선택 순서
가격이 매우 저렴하므로
실패하더라도 타격이 적은
Luna max로 먼저 시도합니다.
Luna max로 반복해도 해결 가능성이 낮거나 시간이 부족하다면 Fable low를 시도합니다.
정리
결론
Claude Fable low 및 Codex Luna max
근거 자료: 프롬프트, 원본 결과, 크레딧 사용량
부록 · Fable low 사용 사례
요구 사항과 티켓의 대응 관계를 확인하고, Gantt 차트에 표시할 순서를 정하는 작업입니다.
Fable low는 요구 사항과 연결된 티켓을 순서대로 정렬하고, 대응 관계를 확인하기 어려운 티켓은 따로 남겼습니다.
자동 정렬 결과를 검토하고, 연결이 불분명한 티켓의 위치는 사람이 판단합니다.
부록 · 비용 구조
주간 할당량은 덜 사용해도 요금이 줄지 않고 다시 채워집니다. 남은 할당량을 소모하기 위해 fast 모드까지 사용하기도 합니다. 구독제 한도 ↗
비용이 고정되어 있으므로 성능이 주요 관심사입니다.
같은 결과를 얻더라도 model과 effort의 조합에 따라 비용이 달라집니다.
성능뿐 아니라 조합별 비용도 함께 비교해야 합니다.
부록 · 우리 팀 테스트를 위한 참고 자료
공개 자료 24개에서 관찰 32항목을 정리했습니다. 같은 실험의 성공·실패·비용을 나누어 다룬 항목도 있습니다.
설정을 구분합니다. Fable 5와 5.1, low 확인 여부, Luna 단독과 다른 모델을 함께 쓴 경우를 표시했습니다.
원인을 단정하지 않습니다. 관찰한 실패와 모델의 고유 약점은 다릅니다. 원문이 공개한 검증 범위를 함께 읽어 주세요.
바로 참고할 소재: 퀴즈 UI·DB 오류, 문서 조회 생략, 수정 범위 보존, 통합 검사 미완료.
확인 2026. 9. 6. · 기존 본편 사례와 구분한 참고 부록입니다.
부록 · 공개 사례 1/8
같은 low에서도 검증 지시와 작업 형태에 따라 결과가 달랐습니다.
퀴즈 기능을 만든 epolanski는 컨트롤러 테스트와 브라우저 전체 흐름 검사를 명시하자 low에서도 성공했다고 보고했습니다.
범위 앞서 오류가 났던 퀴즈 기능을 다시 검증한 결과입니다. 지능 부족보다 검증 절차의 영향도 살펴볼 사례입니다.
우리 팀에서 문체·문서 변환 후 원문 대조를 명시했을 때 누락이 줄어드는지 확인.
Pokédex의 전체 항목을 탐색할 수 있었고, 이중 타입의 배율·면역 계산이 검증에서 맞았습니다.
범위 기능 누락이 보고된 Pokédex와 같은 제출물입니다. 일부 핵심 기능의 성공이며 전체 완성은 아닙니다.
우리 팀에서 중복 할인·예외 조건처럼 여러 규칙을 결합하는 계산 도구 제작.
짧은 응답 20개, JS 수정 6개, 공식 JSON 정보 추출 4개가 작성자의 평가를 통과했습니다.
범위 범위가 좁은 테스트이며 대형 저장소·장시간 작업은 포함하지 않았습니다.
우리 팀에서 공식 데이터에서 값·출처·조회 시각을 정확하게 추출.
대본 10개를 각 5회 작성한 ToneBench에서 종합 88.4점, 문체·어조 88.5점을 기록했습니다.
범위 모델 심사 점수이며 원문 보존형 문체 변경이나 한국어 업무 문서 시험은 아닙니다.
우리 팀에서 팀 문체 지침을 주고 문장 길이·어조·내용 보존을 별도 평가.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 2/8
기능 누락·검증 부족·검색 생략이 드러난 관찰입니다.
첫 실행은 선택지 추가 UI가 깨졌고, 두 번째는 DB 고유성 제약 오류가 났다고 보고했습니다.
범위 개인 실험입니다. 테스트 지시를 보완한 뒤에는 같은 퀴즈 기능을 완성했습니다.
우리 팀에서 기존 양식에 입력 항목을 추가하고 저장·중복·재수정까지 확인.
Pokédex 30개 기능 중 7개가 빠졌고, 기술 목록에는 여러 게임 버전의 데이터가 섞였습니다.
범위 실행 성공과 요구 사항 충족은 다릅니다. 같은 제출물에서 항목 탐색과 이중 타입 계산은 성공했습니다.
우리 팀에서 화면이 열리는지와 전체 요구 사항을 충족하는지를 따로 검사.
39회 중 1회 컴파일 실패. low의 평균은 74.62점이며 설계·접근성 점수가 high보다 낮았습니다.
범위 점수는 모델 심사입니다. 모든 React 작업에 실패한다는 뜻은 아닙니다.
우리 팀에서 폼·설정 화면에서 키보드 조작, 오류 표시, Undo/Redo를 확인.
공식 가이드는 low에서 검색·자료 조회 도구 호출이 줄고, 기억에 의존할 가능성이 커진다고 설명합니다.
범위 개별 실패 실험이 아닌 공식 관찰이며, Fable 5와 구분해야 합니다.
우리 팀에서 문서에만 있는 최신 정보를 질문하고 실제 조회 여부·근거를 확인.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 3/8
저렴한 설정에서도 완료한 구체적 작업이 있으며, 검증 범위는 각각 다릅니다.
WooCommerce 플러그인에서 일반 상품과 옵션 상품의 재고를 변경하고, 실제 저장된 값을 작성자가 확인했습니다.
범위 통합 검사 미완료가 보고된 플러그인의 핵심 기능은 성공했습니다. 전체 요구 사항을 완수한 사례는 아닙니다.
우리 팀에서 엑셀·업무 도구에서 수정값이 실제 저장되고 다시 읽히는지 확인.
LeetCode 3348에서 Accepted를 받았습니다. 생성 511.5초, 당시 API 환산 비용 약 $0.042였습니다.
범위 한 문제를 한 번 실행한 결과입니다. 출제된 문제라 학습 중 노출 가능성도 남습니다.
우리 팀에서 입출력과 정답이 분명한 규칙 계산·데이터 변환부터 시험.
작성자는 숨겨둔 버그 105개 중 33개를 수정했고, 당시 API 환산 비용은 $1.80이라고 보고했습니다.
범위 전부 고친 결과는 아닙니다. 글에서 비교한 Fable의 effort는 이 수치만으로 확인되지 않습니다.
우리 팀에서 원인을 알려주지 않은 작은 결함을 넣고 발견·수정·회귀 여부 평가.
Opus가 만든 인계 내용을 받아 457분 작업하고, 새 Codex 리뷰 지적이 없어질 때까지 수정했다고 보고했습니다.
범위 다른 모델의 계획·리뷰가 포함됐으며, 리뷰 통과가 버그 부재를 증명하지는 않습니다.
우리 팀에서 명확한 수정 목록을 주고 항목별 반영·검증을 끝까지 수행하는지 확인.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 4/8
작은 수정의 범위 보존부터 긴 실행의 완료 여부까지 확인할 소재입니다.
사용자는 작은 UI 수정을 요청했는데 페이지 전체가 삭제됐다고 보고했습니다. 긴 대화와 가득 찬 문맥도 언급했습니다.
범위 코드·재현 로그가 없어 원인은 미확정입니다. 모델 고유 한계로 단정할 수 없습니다.
우리 팀에서 문서 한 문장만 수정한 뒤 나머지 내용·표·링크가 보존됐는지 비교.
버그 수정 실험이 새 CLI에서 한 저장소만 3시간 23분 실행한 뒤에도 결과를 못 내 중단됐습니다.
범위 작성자의 이전 CLI에서는 완료됐습니다. 모델과 실행 환경의 영향을 분리해야 합니다.
우리 팀에서 클라이언트 버전·문맥 압축·중단 시점·마지막 산출물을 함께 기록.
WooCommerce 제작에서 통합 검사 4개 중 2개만 통과했고, 일부 편집 컨트롤도 빠졌습니다.
범위 모델은 검증 미완료를 밝혔지만 자동 스크립트가 완료 처리했습니다. 재고 저장에 성공한 플러그인과 같은 실행입니다.
우리 팀에서 작업 종료·실행 가능·요구 충족을 서로 다른 완료 기준으로 검사.
Luna 구현과 Fable 검토·수정 조합에서 3회 중 2회가 15개 테스트 중 14개만 통과했습니다.
범위 Luna 단독 결과가 아닙니다. 여러 모델과 실행 도구를 합친 결과입니다.
우리 팀에서 기존 페이지·뒤로 가기·직접 링크 등 수정 주변의 동작도 확인.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 5/8
작업 성공과 비용 효율은 별개입니다. 금액은 각 보고 당시의 계산입니다.
리팩터링에서 두 구성 모두 대체로 성공했지만, Luna 작업자를 붙인 쪽의 총비용은 약 30% 높았다고 보고했습니다.
범위 조정자 비용이 대부분이었습니다. Luna 자체의 정답률 실패로 분류하지 않습니다.
우리 팀에서 구현뿐 아니라 지시·검토·재작업까지 합친 총비용을 기록.
작성자는 Luna Max가 Terra High보다 같은 작업에 대략 세 배 오래 걸리고, 긴 작업에서 재수정이 쌓였다고 설명했습니다.
범위 작업 내용·표본 수가 공개되지 않은 개인 관찰입니다. 보편적 배율이 아닙니다.
우리 팀에서 비용과 함께 완료 시간·사용자 개입 횟수를 측정.
Kingy.ai의 코드 수정·정보 추출 평가에서 세 모델 모두 30/30을 통과했습니다. Fable 비용은 $0.211로 Sonnet high의 약 5배였습니다.
범위 앞서 30개 항목을 통과한 테스트와 동일합니다. 이 난이도에서는 추가 품질 이득을 관찰하지 못했습니다.
우리 팀에서 이미 충분히 맞히는 작업에서 비싼 설정을 쓸 이유가 있는지 확인.
작성자는 low로 앱을 한 번에 만들었다고 보고했습니다. 사용 기록의 메시지당 비용은 Opus보다 약 1.6배 높았습니다.
범위 앱 상세 검증은 미공개이며 메시지별 집계는 동일 작업 비교가 아닙니다.
우리 팀에서 결과 품질과 재질문 횟수를 기록하고 메시지 단가와 작업 비용을 구분.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 6/8
주제는 유용하지만 해당 작업의 effort가 확인되지 않거나, 전체 설정에 관한 설명입니다.
작성자는 구조·API·기술 스택이 다른 플러그인으로 거의 한 번에 이식했다고 보고했습니다.
범위 같은 글에 low 평가가 있지만, 이식 실행이 low였다는 근거는 없습니다.
우리 팀에서 기존 양식·도구를 다른 플랫폼으로 옮기는 작업의 후보로 참고.
Opus로 여러 가설을 시험한 뒤, Fable이 새 가설도 틀렸음을 짚고 약 10분 만에 수정 PR을 냈다고 보고했습니다.
범위 low 사용 권고와 별개의 일화입니다. low 성공 사례로 가져오면 안 됩니다.
우리 팀에서 사용자가 제시한 잘못된 원인을 그대로 따라가는지 확인.
공식 가이드는 문장이 조밀해지거나, 문서 요약에 원문을 인용 표시 없이 재사용할 수 있다고 설명합니다.
범위 특정 low 실행의 실패가 아니라 일반적 행동 설명입니다.
우리 팀에서 문체 변경 후 문장 길이·직접 인용·자기 말로 요약했는지 확인.
복잡한 비동기 작업에서 다음 계획만 말하거나, 이미 요청한 단계의 허락을 다시 묻고 멈출 수 있다고 설명합니다.
범위 특정 low 설정의 한계로 귀속할 수 없습니다.
우리 팀에서 완료 보고 문구와 실제 산출물·남은 작업을 대조.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 7/8
배포 YAML 작성과 장애 진단 사례입니다. 아래 실행의 low·max 여부는 확인되지 않았습니다.
비루트 실행·권한 제한·NetworkPolicy·PDB를 작성하고 kubeconform의 엄격한 스키마 검사를 통과했습니다.
범위 실제 클러스터 배포는 검증하지 않았습니다. Namespace는 이미 있다고 가정했습니다.
우리 팀에서 보안·통신 조건을 주고 정적 검사와 실제 배포를 각각 확인.
HolmesGPT 평가에서 crashpod 진단과 UUID로 PVC를 찾는 과제를 각각 3회 모두 통과했습니다.
범위 Codex max 실행이 아닌 HolmesGPT 환경의 결과입니다.
우리 팀에서 Pod 장애 원인이나 PVC 식별을 요청하고 실제 리소스와 대조.
자사 LXC 컨테이너를 조사해 Dockerfile·Kubernetes 템플릿으로 옮기는 요청에서, 관련 API 호출 9건이 거부됐다고 보고했습니다.
범위 안전 장치의 거부 사례입니다. 설계 능력 부족이나 low의 한계로 단정할 수 없습니다.
우리 팀에서 기존 환경을 읽고 배포 초안을 만드는 정상 작업이 완료되는지 확인.
프런트→백엔드 타임아웃 과제를 3회 모두 통과하지 못했습니다. 정답은 프런트 Pod의 접근을 막는 백엔드 정책입니다.
범위 불필요한 스킬 제안 금지 조건도 있습니다. 점수만으로 어떤 조건을 놓쳤는지 알 수 없습니다.
우리 팀에서 레이블·포트·정책을 함께 보고, 원인과 최소 수정안을 확인.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · 공개 사례 8/8
문서의 존재 여부, 최신성, 인용 근거를 각각 확인할 소재입니다. 아래 사례는 effort가 미공개입니다.
존재하지 않는 정부 문서의 요약을 요청하자, 실재 여부를 확인할 수 없다고 밝히고 실제 문서 후보 3개를 제시했습니다.
범위 조건별 1회 실행입니다. 후보 3개 중 2개는 당시 공식 제목·날짜와 일치했습니다.
우리 팀에서 그럴듯한 가짜 문서 제목을 주고 존재 확인부터 하는지 검사.
웹 검색을 활용해 36초 만에 3,983자의 글을 작성했습니다. 검색량 증가의 원인을 확인하지 못한 부분은 미확인으로 밝혔습니다.
범위 독립적인 사실 전수 검증은 없습니다. 14문단으로 요청 범위인 8~12문단을 넘겼습니다.
우리 팀에서 최근 이슈를 조사하게 하고 확인된 사실과 추정의 구분을 검사.
사용자에게는 2026년 7월판이 보이는 공식 페이지에서 2025년 12월판을 읽었습니다. 다시 조회해도 같은 결과였습니다.
범위 최신성을 확인하지 못했다고 밝혔습니다. 검색·조회 환경의 문제인지 원인은 미확정입니다.
우리 팀에서 개정된 문서를 찾게 하고 본문 개정일을 현재 원문과 대조.
외부 감사에서 Luna의 평가 가능한 인용 63개 중 9.5%는 연결된 출처가 해당 주장을 뒷받침하지 못했습니다.
범위 감사 코드 수정 후 수치이며 단일 모델 심사입니다. 열리지 않는 출처는 제외했습니다.
우리 팀에서 핵심 주장마다 링크를 열고 실제로 뒷받침하는 문장을 확인.
확인 2026. 9. 6. · 외부 보고이며 자체 재현은 하지 않았습니다. ‘우리 팀에서’는 테스트 제안입니다. 목록으로 ↑
부록 · Tibo의 effort 선택 권고
Tibo (@thsottiaux) · OpenAI Codex·ChatGPT · 2026. 9. 6.
기존 모델에서 쓰던 높은 effort를
새 모델에서도 그대로 쓸 필요는 없습니다.Sol High에 만족했던 사용자를 위한 권고입니다.
Tibo · X 원문 ↗ · 이미지를 누르면 확대됩니다.