AI 활용의 새로운 흐름 01 / 25

60분 세미나 · 공개 자료 및 직접 실행

AI 활용의
새로운 흐름

최근 AI 사용 방식을 조사하고 직접 시험하여 우리 업무에 적용할 수 있는지 검토합니다.

검토 항목: 완료 조건, 작업 시간, 크레딧 사용량

이 변환에 사용한 비용은
얼마일까요?

가장 가까운 금액을 맞힌 분께 상품을 드립니다.

츄라이 츄라이

오늘 세미나의 목적

식객의 등장인물이 외국인에게 음식을 권하며 헤이, 츄라이, 츄라이라고 말하는 두 번째 컷
허영만, 『식객』 16권 79화 「집단 가출」

기존의 일반적인 선택 방식

어려운 문제 = 좋은 model + 높은 effort?

일반적인 접근어려운 문제에는 성능이 높은 모델과 높은 effort를 함께 선택했습니다. 선택의 고민성능이 높은 모델을 선택할수록 비용 부담도 커질 수 있습니다. 작업에 필요한 성능과 비용을 함께 비교해야 합니다. 비용과 할당량한정된 예산과 할당량 안에서 모델을 선택해야 합니다. 작업에 맞는 model과 effort 조합을 찾는 것이 중요합니다.
새로운 흐름

model과 effort를 항상 함께 높이지 않고, 작업에 맞게 각각 조절합니다.

Codex Luna × max effort Claude Fable × low effort

여기서 드는 의문

양손을 벌리고 의아한 표정을 짓는 페페 원본 밈
Pepe_Shrug · Emoji.gg ↗

엥? 좋은 모델이 오래 생각해야 문제를 잘 푸는 건 당연한 거 아님?

좋은 모델을 LOW로? 나쁜 모델을 MAX로? 왜?

Model × Effort

문제 해결력을 높이는 두 가지 방법

Model 변경

더 높은 지능의 모델 선택

  • AI의 기본 지능과 풀 수 있는 문제의 범위를 정합니다.
  • 지능이 높은 AI는 적은 노력으로도 더 좋은 답을 낼 수 있습니다.

Effort 증가

같은 모델을 더 생각시키기

  • effort가 높을수록 대체로 더 오래 생각합니다.
  • 여러 해법을 비교하고, 오류나 누락을 다시 확인할 수 있습니다.

둘 다 높이면 비용도 커집니다.

어떤 조합이 합리적일까?

모델과 effort별 점수·비용 비교

FrontierCode 1.1 Main

AI 코딩 제품 개발사 Cognition의 자체 평가 · 왼쪽일수록 비용이 낮습니다.

FrontierCode 1.1 Main 원본 그래프. Fable 5.1, Opus 5, Astra, Sol, Luna 등 모델의 effort별 점수와 작업당 평균 비용을 연결한 선 그래프.

FrontierCode 1.1 Main 원문 ↗ · 주요 7개 모델의 원본 그래프 · 2026. 9. 6. 캡처 · 이미지를 누르면 확대됩니다.
비용 절감률 = (High 비용 − 비교 설정 비용) ÷ High 비용 × 100 · 작업 1회당 평균 비용 · 원문 표의 표시값으로 계산

모델과 effort별 점수·비용 비교

CursorBench 3.2

AI 코딩 제품 개발사 Cursor의 자체 평가 · 오른쪽일수록 비용이 낮습니다.

CursorBench 3.2 원본 그래프. Fable 5.1, Opus 5, Sol, Luna 등 모델의 effort별 점수와 작업당 평균 비용을 연결한 선 그래프.

CursorBench 3.2 원문 ↗ · Fable 5.1 등 주요 모델의 원본 그래프 · 2026. 9. 6. 캡처 · 이미지를 누르면 확대됩니다.
비용 절감률 = (High 비용 − 비교 설정 비용) ÷ High 비용 × 100 · 공개 API 단가 기준 · Luna는 Cursor 환경에서 평가한 결과

그래도 궁금한 건

입을 크게 벌리고 양손을 내밀며 화내는 페페
페페 원본 밈 · Know Your Meme ↗

나는 벤치마크
안 믿어!

점수만 좋고,
써보면 별로 아냐?

공개 반응 · 2026년 9월 4일 확인

여러 실무자들이 경험적 평가로 추천합니다

정확한 설정명을 직접 언급한 검색 표본은 106건이며, 이 가운데 67건이 긍정적이었습니다. 추천 이유가 구체적인 의견을 10건씩 골랐습니다.

Codex Luna max

긍정 29 · 중립·혼합 14 · 부정 6

총 49건대표 의견 10건
Vaibhav Srivastav의 Luna max 원문 일부
Vaibhav SrivastavOpenAI · ♥ 1천

GPT-5.5 xhigh와 비슷한 점수를 훨씬 낮은 비용에 제공한다고 소개했습니다.

원문 ↗
Dan McAteer의 Luna max 원문 일부
Dan McAteersol-advisor · ♥ 3.6천

정형 구현을 Luna max에 맡기는 공개 워크플로를 제안했습니다.

원문 ↗
Paweł Huryn의 Luna max 원문 일부
Paweł HurynLinkedIn · 135

숨은 버그 105개 중 33개를 수정했으며 API 환산 비용은 1.80달러였다고 보고했습니다.

원문 ↗
Derya Unutmaz의 Luna max 원문 일부
Derya UnutmazJAX · ♥ 544

프런트엔드를 제외하면 코딩 품질이 좋고 비용도 낮다고 평가했습니다.

원문 ↗
Alex Razvant의 Luna max 원문 일부
Alex RazvantAxon · LinkedIn · 40

범위가 명확한 구현에서 지능과 비용의 균형이 좋다고 평가했습니다.

원문 ↗
iKontact의 Luna max 원문 일부
iKontactReddit · ▲ 139

크레딧 소모가 작고 코드 품질도 기대보다 좋았다고 평가했습니다.

원문 ↗
ChineseEngineer의 Luna 사용 의견 일부
ChineseEngineerReddit 댓글 · ▲ 53

느리고 오류도 있지만 대부분의 작업에 계속 사용한다고 밝혔습니다.

원문 ↗
Zoltan Karasz의 Luna max 원문 일부
Zoltan KaraszLinkedIn · 7

DeepSWE에서 GPT-5.5 xhigh와 같은 통과율을 약 12분의 1 비용으로 기록했다고 해석했습니다.

원문 ↗

Claude Fable low

긍정 38 · 중립·혼합 11 · 부정 8

총 57건대표 의견 10건
Morgan Linton의 Fable low 원문 일부
Morgan LintonVulcanBench · LinkedIn

low가 영리하고 Opus보다 저렴하다고 평가했습니다.

원문 ↗
Peter Gostev의 Fable low 원문 일부
Peter GostevLMArena · LinkedIn · 30

effort별 결과를 비교하고 low의 효율과 품질을 높게 평가했습니다.

원문 ↗
Mark Kashef의 Fable low 원문 일부
Mark KashefLinkedIn · 24

Fable 5 low가 Opus 4.8 max와 대략 비슷하다고 평가했습니다.

원문 ↗
Jan-Niklas Wortmann의 Fable low 원문 일부
Jan-Niklas WortmannJetBrains · LinkedIn · 52

low도 충분히 유능하며 xhigh보다 빠르다고 평가했습니다.

원문 ↗
Bitter Election 7518의 Fable low 원문 일부
Bitter_Election_7518Reddit · ▲ 121

가격과 간결한 응답 방식이 인상적이라고 평가했습니다.

원문 ↗
Charwoodthethird의 Fable low 원문 일부
CharwoodthethirdReddit 댓글 · ▲ 90

Fable low가 다른 모델을 관리하도록 하면 사용량을 아낄 수 있다고 제안했습니다.

원문 ↗
weks의 Fable low 원문 일부
weksReddit 댓글 · ▲ 60

자신의 코드에 low를 사용했고 결과에 만족했다고 밝혔습니다.

원문 ↗
brhkim의 Fable low 원문 일부
brhkimReddit · ▲ 53

high보다 사용량을 아끼는 일상 설정으로 추천했습니다.

원문 ↗

2026년 9월 4일에 확인한 검색 표본이며, 웹 전체 게시물 수나 여론을 뜻하지 않습니다. * 공개 미러 표시값 ·

이제 우리 차례

파란 옷을 입고 손으로 턱을 괴며 고민하는 페페 원본 밈
Pepe · PNGMart ↗

우리 일에 맡겨도 괜찮을까?

분명 한계가 있을 텐데?

직접 실행

Codex Luna max

2026. 7. 30. API 가격 80% 인하 · Codex 크레딧 차감량도 인하 ↗

언제 쓰면 좋을까?
  • 지시가 명료하거나, 순서가 분명하거나, 평가 항목이 구체적으로 명시된 작업
  • 결과물의 성공/실패를 즉각 판단할 수 있는 작업
  • 실패가 치명적이지 않고, 급하지 않아 천천히 다시 시도할 수 있는 작업

성공 사례 3건

  1. UI 변경 요구사항을 55회에 걸쳐 수정

    결과다양한 요구 사항을 단시간에 반영하여 명시적인 의사소통 기준으로 활용했습니다.

    사용 비용$1.59

  2. 결과

    사용 비용

  3. 결과

    사용 비용

실패 사례 3건

  1. 제공한 형식에 맞춰 회의록 초안을 회의록 문서로 변환

    결과변환 결과에서 원문의 일부 내용이 누락되고 의미가 변질되었습니다.

    실패 이유제공한 형식만으로는 각 내용을 어느 항목에 배치해야 하는지 명확하지 않았습니다.

    사용 비용

  2. 기존 글의 문체 변경 (예정)

    확인할 점원문의 내용과 의미를 유지하면서 요청한 문체로 바꾸는지 확인할 예정입니다.

    결과실행 전 · 결과 미확인

    사용 비용

  3. 결과

    사용 비용

직접 실행

Claude Fable low

언제 쓰면 좋을까?
  • 명료하게 지시하기 어렵거나 구체적인 평가 항목을 만들어야 할 때
  • 결과물을 사람이 일일이 검토하기 어려운 작업
  • 한 번의 실패가 치명적일 가능성이 있는 작업

성공 사례 3건

  1. 상세 요구 사항과 Jira 티켓을 맞춰 Gantt 차트 순서로 정렬

    결과연결된 티켓은 요구 사항 순서로 정렬했고, 연결이 불분명한 티켓은 차트 아래에 남겼습니다.

    사용 비용

  2. 결과

    사용 비용

  3. 결과

    사용 비용

실패 사례 3건

  1. 결과

    사용 비용

  2. 결과

    사용 비용

  3. 결과

    사용 비용

모델과 effort 선택 순서

뭘 선택해야 좋을지 잘 모르겠다면?

1 먼저 시도,
시간이 많다면

Codex Luna max

가격이 매우 저렴하므로
실패하더라도 타격이 적은
Luna max로 먼저 시도합니다.

2 반복해도 해결 가능성이 낮거나,
시간이 부족하면

Claude Fable low

Luna max로 반복해도 해결 가능성이 낮거나 시간이 부족하다면 Fable low를 시도합니다.

3 Fable low 실행 후

사람이 산출물을 평가

작업이 완료되었으면종료
해법이 구체화되면Luna max로 수행
사람이 작은 작업으로 나눌 수 있으면Luna에 작업별로 개별 요청
추가 추론이 필요하면Fable effort를 높여 재시도

정리

오늘 확인한 선택 기준

Codex Luna max지시가 명료하거나 순서가 분명하거나 평가 항목이 구체적으로 명시되어 있고, 결과물의 성공/실패를 즉각 판단할 수 있으며, 실패가 치명적이지 않고 급하지 않아 천천히 다시 시도할 수 있는 구현
Claude Fable low명료하게 지시하기 어렵거나 구체적인 평가 항목을 만들어야 하고, 결과물을 사람이 일일이 검토하기 어려우며, 한 번의 실패가 치명적일 가능성이 있는 작업
선택 순서문제 수준을 잘 모르겠다면 Luna max부터 시도합니다. 해결 가능성이 낮다면 Fable low의 산출물을 사람이 평가합니다. 작업이 완료되었으면 종료하고, 해법이 구체화되면 Luna max로 수행합니다. 사람이 작은 작업으로 나눠 Luna에 개별 요청하거나, 추가 추론이 필요하면 Fable의 effort를 높입니다.

결론

아직 사용해 보지 않았다면,
한 번 직접 써 보세요

Claude Fable low 및 Codex Luna max

근거 자료: 프롬프트, 원본 결과, 크레딧 사용량

파란 옷을 입고 밝게 웃으며 윙크하고 엄지를 치켜든 페페
엄지척 페페 · Pinterest ↗

부록 · Fable low 사용 사례

Jira 티켓을
Gantt 차트 순서로 정렬

작업 상황

요구 사항을 기준으로 티켓 정렬

요구 사항과 티켓의 대응 관계를 확인하고, Gantt 차트에 표시할 순서를 정하는 작업입니다.

Fable low 실행 결과

연결된 티켓을 요구 사항 순서로 정렬

Fable low는 요구 사항과 연결된 티켓을 순서대로 정렬하고, 대응 관계를 확인하기 어려운 티켓은 따로 남겼습니다.

사람이 확인할 부분

대응 관계와 최종 순서

자동 정렬 결과를 검토하고, 연결이 불분명한 티켓의 위치는 사람이 판단합니다.

부록 · 비용 구조

비용 구조에 따른 관점 차이

정액 구독제

할당량 내 비용 동일

주간 할당량은 덜 사용해도 요금이 줄지 않고 다시 채워집니다. 남은 할당량을 소모하기 위해 fast 모드까지 사용하기도 합니다. 구독제 한도 ↗

비용이 고정되어 있으므로 성능이 주요 관심사입니다.

Enterprise 요금제

사용량 = 비용

같은 결과를 얻더라도 model과 effort의 조합에 따라 비용이 달라집니다.

성능뿐 아니라 조합별 비용도 함께 비교해야 합니다.

부록 · 우리 팀 테스트를 위한 참고 자료

[외부사례] 무엇을 해냈고, 어디서 막혔을까?

공개 자료 24개에서 관찰 32항목을 정리했습니다. 같은 실험의 성공·실패·비용을 나누어 다룬 항목도 있습니다.

설정을 구분합니다. Fable 5와 5.1, low 확인 여부, Luna 단독과 다른 모델을 함께 쓴 경우를 표시했습니다.

원인을 단정하지 않습니다. 관찰한 실패와 모델의 고유 약점은 다릅니다. 원문이 공개한 검증 범위를 함께 읽어 주세요.

바로 참고할 소재: 퀴즈 UI·DB 오류, 문서 조회 생략, 수정 범위 보존, 통합 검사 미완료.

부록 · 공개 사례 1/8

Fable low · 해낸 일

같은 low에서도 검증 지시와 작업 형태에 따라 결과가 달랐습니다.

실패 후 개선Fable 5 · low

테스트 지시 후 퀴즈 기능 완성

퀴즈 기능을 만든 epolanski는 컨트롤러 테스트와 브라우저 전체 흐름 검사를 명시하자 low에서도 성공했다고 보고했습니다.

범위 앞서 오류가 났던 퀴즈 기능을 다시 검증한 결과입니다. 지능 부족보다 검증 절차의 영향도 살펴볼 사례입니다.

우리 팀에서 문체·문서 변환 후 원문 대조를 명시했을 때 누락이 줄어드는지 확인.

epolanski · Hacker News ↗ · 상위 원문 ↗

코드·실행 평가Fable 5 · low

1,025개 항목과 복합 규칙 구현

Pokédex의 전체 항목을 탐색할 수 있었고, 이중 타입의 배율·면역 계산이 검증에서 맞았습니다.

범위 기능 누락이 보고된 Pokédex와 같은 제출물입니다. 일부 핵심 기능의 성공이며 전체 완성은 아닙니다.

우리 팀에서 중복 할인·예외 조건처럼 여러 규칙을 결합하는 계산 도구 제작.

guitaripod · Pokédex 평가 ↗

실행 테스트Fable 5.1 · low

코드 수정·정보 추출 30/30 통과

짧은 응답 20개, JS 수정 6개, 공식 JSON 정보 추출 4개가 작성자의 평가를 통과했습니다.

범위 범위가 좁은 테스트이며 대형 저장소·장시간 작업은 포함하지 않았습니다.

우리 팀에서 공식 데이터에서 값·출처·조회 시각을 정확하게 추출.

Kingy.ai · 자체 실행 평가 ↗

글쓰기 벤치마크Fable 5 · low

스타일 지침에 맞춘 영상 대본

대본 10개를 각 5회 작성한 ToneBench에서 종합 88.4점, 문체·어조 88.5점을 기록했습니다.

범위 모델 심사 점수이며 원문 보존형 문체 변경이나 한국어 업무 문서 시험은 아닙니다.

우리 팀에서 팀 문체 지침을 주고 문장 길이·어조·내용 보존을 별도 평가.

Towards AI · ToneBench ↗

부록 · 공개 사례 2/8

Fable low · 실패와 한계

기능 누락·검증 부족·검색 생략이 드러난 관찰입니다.

사용자 실험Fable 5 · low

객관식 퀴즈 기능: 2회 모두 오류

첫 실행은 선택지 추가 UI가 깨졌고, 두 번째는 DB 고유성 제약 오류가 났다고 보고했습니다.

범위 개인 실험입니다. 테스트 지시를 보완한 뒤에는 같은 퀴즈 기능을 완성했습니다.

우리 팀에서 기존 양식에 입력 항목을 추가하고 저장·중복·재수정까지 확인.

epolanski · Hacker News ↗ · 상위 원문 ↗

코드·실행 평가Fable 5 · low

앱은 켜졌지만 요구 기능 누락

Pokédex 30개 기능 중 7개가 빠졌고, 기술 목록에는 여러 게임 버전의 데이터가 섞였습니다.

범위 실행 성공과 요구 사항 충족은 다릅니다. 같은 제출물에서 항목 탐색과 이중 타입 계산은 성공했습니다.

우리 팀에서 화면이 열리는지와 전체 요구 사항을 충족하는지를 따로 검사.

guitaripod · Pokédex 평가 ↗

반복 벤치마크Fable 5 · low

React: 컴파일 실패와 완성도 저하

39회 중 1회 컴파일 실패. low의 평균은 74.62점이며 설계·접근성 점수가 high보다 낮았습니다.

범위 점수는 모델 심사입니다. 모든 React 작업에 실패한다는 뜻은 아닙니다.

우리 팀에서 폼·설정 화면에서 키보드 조작, 오류 표시, Undo/Redo를 확인.

uhyo · React Profession Bench ↗

공식 행동 설명Fable 5.1 · low

자료를 찾지 않고 기억으로 답변

공식 가이드는 low에서 검색·자료 조회 도구 호출이 줄고, 기억에 의존할 가능성이 커진다고 설명합니다.

범위 개별 실패 실험이 아닌 공식 관찰이며, Fable 5와 구분해야 합니다.

우리 팀에서 문서에만 있는 최신 정보를 질문하고 실제 조회 여부·근거를 확인.

Anthropic · Fable 5.1 가이드 ↗

부록 · 공개 사례 3/8

Luna max · 해낸 일

저렴한 설정에서도 완료한 구체적 작업이 있으며, 검증 범위는 각각 다릅니다.

코드·수동 검증GPT-5.6 Luna · max

상품 옵션별 재고 저장 구현

WooCommerce 플러그인에서 일반 상품과 옵션 상품의 재고를 변경하고, 실제 저장된 값을 작성자가 확인했습니다.

범위 통합 검사 미완료가 보고된 플러그인의 핵심 기능은 성공했습니다. 전체 요구 사항을 완수한 사례는 아닙니다.

우리 팀에서 엑셀·업무 도구에서 수정값이 실제 저장되고 다시 읽히는지 확인.

Nathan Onn · WordPress 제작기 ↗

외부 채점 통과GPT-5.6 Luna · max

알고리즘 문제의 정답 제출

LeetCode 3348에서 Accepted를 받았습니다. 생성 511.5초, 당시 API 환산 비용 약 $0.042였습니다.

범위 한 문제를 한 번 실행한 결과입니다. 출제된 문제라 학습 중 노출 가능성도 남습니다.

우리 팀에서 입출력과 정답이 분명한 규칙 계산·데이터 변환부터 시험.

CarsonBuilds · Reddit 실험 ↗

사용자 실험GPT-5.6 Luna · max

숨긴 버그 105개 중 33개 수정

작성자는 숨겨둔 버그 105개 중 33개를 수정했고, 당시 API 환산 비용은 $1.80이라고 보고했습니다.

범위 전부 고친 결과는 아닙니다. 글에서 비교한 Fable의 effort는 이 수치만으로 확인되지 않습니다.

우리 팀에서 원인을 알려주지 않은 작은 결함을 넣고 발견·수정·회귀 여부 평가.

Paweł Huryn · 버그 수정 실험 ↗

사용자 보고Luna max + Opus 인계

대형 PR의 리뷰 수정 반복

Opus가 만든 인계 내용을 받아 457분 작업하고, 새 Codex 리뷰 지적이 없어질 때까지 수정했다고 보고했습니다.

범위 다른 모델의 계획·리뷰가 포함됐으며, 리뷰 통과가 버그 부재를 증명하지는 않습니다.

우리 팀에서 명확한 수정 목록을 주고 항목별 반영·검증을 끝까지 수행하는지 확인.

xogno · Reddit 사용기 ↗

부록 · 공개 사례 4/8

Luna max · 실패와 한계

작은 수정의 범위 보존부터 긴 실행의 완료 여부까지 확인할 소재입니다.

사용자 보고GPT-5.6 Luna · max

작은 UI 수정 중 페이지 삭제

사용자는 작은 UI 수정을 요청했는데 페이지 전체가 삭제됐다고 보고했습니다. 긴 대화와 가득 찬 문맥도 언급했습니다.

범위 코드·재현 로그가 없어 원인은 미확정입니다. 모델 고유 한계로 단정할 수 없습니다.

우리 팀에서 문서 한 문장만 수정한 뒤 나머지 내용·표·링크가 보존됐는지 비교.

UnluckyBeautiful4828 · Reddit ↗ · 상위 원문 ↗

환경 회귀 보고GPT-5.6 Luna · max

CLI 변경 후 3시간 넘게 미완료

버그 수정 실험이 새 CLI에서 한 저장소만 3시간 23분 실행한 뒤에도 결과를 못 내 중단됐습니다.

범위 작성자의 이전 CLI에서는 완료됐습니다. 모델과 실행 환경의 영향을 분리해야 합니다.

우리 팀에서 클라이언트 버전·문맥 압축·중단 시점·마지막 산출물을 함께 기록.

phuryn · Codex GitHub 이슈 ↗

코드·수동 검증GPT-5.6 Luna · max

플러그인 통합 검증은 2/4 통과

WooCommerce 제작에서 통합 검사 4개 중 2개만 통과했고, 일부 편집 컨트롤도 빠졌습니다.

범위 모델은 검증 미완료를 밝혔지만 자동 스크립트가 완료 처리했습니다. 재고 저장에 성공한 플러그인과 같은 실행입니다.

우리 팀에서 작업 종료·실행 가능·요구 충족을 서로 다른 완료 기준으로 검사.

Nathan Onn · WordPress 제작기 ↗

복합 환경 실험Luna max + 검토 모델

React 이식 후 테스트 일부 실패

Luna 구현과 Fable 검토·수정 조합에서 3회 중 2회가 15개 테스트 중 14개만 통과했습니다.

범위 Luna 단독 결과가 아닙니다. 여러 모델과 실행 도구를 합친 결과입니다.

우리 팀에서 기존 페이지·뒤로 가기·직접 링크 등 수정 주변의 동작도 확인.

Tom Skeggs · Fresh Worktree ↗

부록 · 공개 사례 5/8

비용·시간 · 기대와 달랐던 점

작업 성공과 비용 효율은 별개입니다. 금액은 각 보고 당시의 계산입니다.

워크플로 비용Sol + Luna max

저렴한 작업자를 붙여도 총비용 증가

리팩터링에서 두 구성 모두 대체로 성공했지만, Luna 작업자를 붙인 쪽의 총비용은 약 30% 높았다고 보고했습니다.

범위 조정자 비용이 대부분이었습니다. Luna 자체의 정답률 실패로 분류하지 않습니다.

우리 팀에서 구현뿐 아니라 지시·검토·재작업까지 합친 총비용을 기록.

auto_off · Reddit 비용 분석 ↗

시간 관련 보고GPT-5.6 Luna · max

같은 작업에 약 3배의 시간

작성자는 Luna Max가 Terra High보다 같은 작업에 대략 세 배 오래 걸리고, 긴 작업에서 재수정이 쌓였다고 설명했습니다.

범위 작업 내용·표본 수가 공개되지 않은 개인 관찰입니다. 보편적 배율이 아닙니다.

우리 팀에서 비용과 함께 완료 시간·사용자 개입 횟수를 측정.

Available_Yam_6267 · Reddit ↗

같은 평가의 비용Fable 5.1 · low

30/30 통과해도 더 비싼 선택

Kingy.ai의 코드 수정·정보 추출 평가에서 세 모델 모두 30/30을 통과했습니다. Fable 비용은 $0.211로 Sonnet high의 약 5배였습니다.

범위 앞서 30개 항목을 통과한 테스트와 동일합니다. 이 난이도에서는 추가 품질 이득을 관찰하지 못했습니다.

우리 팀에서 이미 충분히 맞히는 작업에서 비싼 설정을 쓸 이유가 있는지 확인.

Kingy.ai · 자체 실행 평가 ↗

개인 사용 기록Fable 5 · low

앱 제작은 성공, 비용은 별도 확인

작성자는 low로 앱을 한 번에 만들었다고 보고했습니다. 사용 기록의 메시지당 비용은 Opus보다 약 1.6배 높았습니다.

범위 앱 상세 검증은 미공개이며 메시지별 집계는 동일 작업 비교가 아닙니다.

우리 팀에서 결과 품질과 재질문 횟수를 기록하고 메시지 단가와 작업 비용을 구분.

Aaron Meese · 개인 사용 기록 ↗

부록 · 공개 사례 6/8

추가 참고 · low로 단정하면 안 되는 사례

주제는 유용하지만 해당 작업의 effort가 확인되지 않거나, 전체 설정에 관한 설명입니다.

사용자 보고Fable 5 · effort 미확인

VS Code 확장을 JetBrains로 이식

작성자는 구조·API·기술 스택이 다른 플러그인으로 거의 한 번에 이식했다고 보고했습니다.

범위 같은 글에 low 평가가 있지만, 이식 실행이 low였다는 근거는 없습니다.

우리 팀에서 기존 양식·도구를 다른 플랫폼으로 옮기는 작업의 후보로 참고.

Jan-Niklas Wortmann · LinkedIn ↗

사용자 보고Fable 5 · effort 미확인

잘못된 가설을 버리고 결함 수정

Opus로 여러 가설을 시험한 뒤, Fable이 새 가설도 틀렸음을 짚고 약 10분 만에 수정 PR을 냈다고 보고했습니다.

범위 low 사용 권고와 별개의 일화입니다. low 성공 사례로 가져오면 안 됩니다.

우리 팀에서 사용자가 제시한 잘못된 원인을 그대로 따라가는지 확인.

Kevin London · 디버깅 사용기 ↗

공식 행동 설명Fable 5.1 · low 한정 아님

문장이 길어지고 인용 구분 누락

공식 가이드는 문장이 조밀해지거나, 문서 요약에 원문을 인용 표시 없이 재사용할 수 있다고 설명합니다.

범위 특정 low 실행의 실패가 아니라 일반적 행동 설명입니다.

우리 팀에서 문체 변경 후 문장 길이·직접 인용·자기 말로 요약했는지 확인.

Anthropic · Fable 5.1 가이드 ↗

공식 행동 설명Fable 5.1 · low 한정 아님

진행 계획만 말하고 작업을 멈춤

복잡한 비동기 작업에서 다음 계획만 말하거나, 이미 요청한 단계의 허락을 다시 묻고 멈출 수 있다고 설명합니다.

범위 특정 low 설정의 한계로 귀속할 수 없습니다.

우리 팀에서 완료 보고 문구와 실제 산출물·남은 작업을 대조.

Anthropic · Fable 5.1 가이드 ↗

부록 · 공개 사례 7/8

Kubernetes · 해낸 일과 한계

배포 YAML 작성과 장애 진단 사례입니다. 아래 실행의 low·max 여부는 확인되지 않았습니다.

성공 · 정적 검증Fable 5.1 · API 기본 설정

보안 조건을 반영한 배포 YAML 작성

비루트 실행·권한 제한·NetworkPolicy·PDB를 작성하고 kubeconform의 엄격한 스키마 검사를 통과했습니다.

범위 실제 클러스터 배포는 검증하지 않았습니다. Namespace는 이미 있다고 가정했습니다.

우리 팀에서 보안·통신 조건을 주고 정적 검사와 실제 배포를 각각 확인.

ComputingForGeeks · 자체 실행 평가 ↗

성공 · 반복 평가Luna · effort 미공개

중단된 Pod 진단·PVC 찾기

HolmesGPT 평가에서 crashpod 진단과 UUID로 PVC를 찾는 과제를 각각 3회 모두 통과했습니다.

범위 Codex max 실행이 아닌 HolmesGPT 환경의 결과입니다.

우리 팀에서 Pod 장애 원인이나 PVC 식별을 요청하고 실제 리소스와 대조.

HolmesGPT · 장애 진단 평가 ↗

한계 · 사용자 보고Fable 5 · effort 미공개

배포 템플릿을 만들다 요청 거부

자사 LXC 컨테이너를 조사해 Dockerfile·Kubernetes 템플릿으로 옮기는 요청에서, 관련 API 호출 9건이 거부됐다고 보고했습니다.

범위 안전 장치의 거부 사례입니다. 설계 능력 부족이나 low의 한계로 단정할 수 없습니다.

우리 팀에서 기존 환경을 읽고 배포 초안을 만드는 정상 작업이 완료되는지 확인.

Vadej-main · Claude Code 이슈 ↗

한계 · 반복 평가Luna · effort 미공개

NetworkPolicy 장애 평가 0/3

프런트→백엔드 타임아웃 과제를 3회 모두 통과하지 못했습니다. 정답은 프런트 Pod의 접근을 막는 백엔드 정책입니다.

범위 불필요한 스킬 제안 금지 조건도 있습니다. 점수만으로 어떤 조건을 놓쳤는지 알 수 없습니다.

우리 팀에서 레이블·포트·정책을 함께 보고, 원인과 최소 수정안을 확인.

HolmesGPT · 장애 진단 평가 ↗

부록 · 공개 사례 8/8

정보 탐색·검색 · 해낸 일과 한계

문서의 존재 여부, 최신성, 인용 근거를 각각 확인할 소재입니다. 아래 사례는 effort가 미공개입니다.

성공 · 사용자 실험Fable 5 · effort 미공개

없는 문서를 검색 후 걸러냄

존재하지 않는 정부 문서의 요약을 요청하자, 실재 여부를 확인할 수 없다고 밝히고 실제 문서 후보 3개를 제시했습니다.

범위 조건별 1회 실행입니다. 후보 3개 중 2개는 당시 공식 제목·날짜와 일치했습니다.

우리 팀에서 그럴듯한 가짜 문서 제목을 주고 존재 확인부터 하는지 검사.

Kyoko · 검색 검증 실험 ↗

성공 · 검색을 활용한 작성Luna · effort 미공개

검색 추세를 조사해 한국어 글 작성

웹 검색을 활용해 36초 만에 3,983자의 글을 작성했습니다. 검색량 증가의 원인을 확인하지 못한 부분은 미확인으로 밝혔습니다.

범위 독립적인 사실 전수 검증은 없습니다. 14문단으로 요청 범위인 8~12문단을 넘겼습니다.

우리 팀에서 최근 이슈를 조사하게 하고 확인된 사실과 추정의 구분을 검사.

AI NoteLab · 검색·글 작성 실험 ↗

한계 · 같은 실험의 관찰Fable 5 · effort 미공개

공식 페이지를 읽었지만 구버전

사용자에게는 2026년 7월판이 보이는 공식 페이지에서 2025년 12월판을 읽었습니다. 다시 조회해도 같은 결과였습니다.

범위 최신성을 확인하지 못했다고 밝혔습니다. 검색·조회 환경의 문제인지 원인은 미확정입니다.

우리 팀에서 개정된 문서를 찾게 하고 본문 개정일을 현재 원문과 대조.

Kyoko · 검색 검증 실험 ↗

한계 · 외부 인용 감사Luna · effort 미공개

인용 링크와 주장이 불일치

외부 감사에서 Luna의 평가 가능한 인용 63개 중 9.5%는 연결된 출처가 해당 주장을 뒷받침하지 못했습니다.

범위 감사 코드 수정 후 수치이며 단일 모델 심사입니다. 열리지 않는 출처는 제외했습니다.

우리 팀에서 핵심 주장마다 링크를 열고 실제로 뒷받침하는 문장을 확인.

Kevin Bright · Tusk 인용 감사 ↗

부록 · Tibo의 effort 선택 권고

Sol High에 만족했다면, Astra Low·Medium

Tibo (@thsottiaux) · OpenAI Codex·ChatGPT · 2026. 9. 6.

Tibo는 Astra low가 Sol high보다 성능이 좋으며, 기존 Sol high에 만족했다면 Astra low 또는 medium을 권한다고 썼습니다.

기존 모델에서 쓰던 높은 effort를
새 모델에서도 그대로 쓸 필요는 없습니다.Sol High에 만족했던 사용자를 위한 권고입니다.