AI 모델 등급 고르는 기준 — 무거운 쪽만 쓰다 정한 세 가지

AI 모델 등급 고르는 기준 — 무거운 쪽만 쓰다 정한 세 가지

작성자

카테고리:

AI 등급을 나눠 쓴다는 게 뭔지, 처음엔 잘 몰랐다. 세션 다섯 개를 나눠 써본 뒤로 어느 세션은 대답이 금방 오고 어느 세션은 한참 걸린다는 걸 알아챘는데, 그 차이가 등급 때문이라는 걸 나중에야 알았다. 무거운 쪽으로 몰아 쓰고서 후회하고, 가벼운 쪽으로 옮겨서도 후회한 끝에야 지금 쓰는 기준 세 가지를 정리했다. 정답을 찾았다기보다는, 두 번 크게 헛다리를 짚고 나서 세 번째 시도에 겨우 자리를 잡은 방식에 더 가깝다.

늦은 밤 책상에서 커피 한 잔을 옆에 두고 키보드를 두드리는 손, 메모지가 흩어진 모습 — 도입부 분위기 컷

미리 보면 이렇습니다

  • ⚙️ AI 등급은 셋 — 가벼운 것, 중간 것, 무거운 것
  • 🔁 처음엔 무거운 쪽으로 몰아 쓰다가, 나중엔 가벼운 쪽으로 몰아 써봤다
  • 📐 지금 쓰는 기준은 세 가지 — 작업 성격에 따라 나눈다
  • 🔍 등급 차이를 정밀하게 측정한 건 아니다, 체감을 정리한 기록이다(숫자로 재본 것 아님)

목차

세션 다섯 개를 나눠 쓰다가 알아챈 것

세션 다섯 개를 나눠 써본 밤 이야기는 클로드 코드 세션 다섯 개를 켠 밤, 가장 오래 붙잡은 건 폰과 컴퓨터 사이였다에 적어뒀다. 그 뒤로 며칠 동안 세션을 계속 켜놓고 지내면서 이상한 걸 하나 알아챘다. 어떤 세션은 물어보면 몇 초 만에 답이 왔는데, 어떤 세션은 같은 성격의 질문인데도 한참을 기다려야 했다. 처음엔 그날그날 서버 상태가 다른가 싶었다.

뭔가 이상하다 싶어서 화면 위쪽을 다시 들여다보고서야 알았다. 세션마다 지금 쓰고 있는 등급이 작게 표시돼 있었는데, 그게 세션마다 달랐다. 새 세션을 시작할 때마다 등급 하나를 골라야 했는데, 그 순간엔 그게 별 의미 없는 절차인 줄로만 알았다. 대답이 빨리 오고 늦게 오고의 차이가 바로 그 작은 선택 하나에서 갈리고 있었다.

무거운 쪽으로 몰아 썼다가 걸린 것

등급이 있다는 걸 안 다음 처음 한 일은, 켜는 세션마다 전부 무거운 등급으로 맞추는 것이었다. 이름 그대로 가장 힘이 센 등급이라고 하니 다 이걸로 맞추면 손해 볼 일이 없겠다 싶었다.

크고 느린 톱니바퀴와 작고 빠른 톱니바퀴가 맞물려 도는, 무거운 등급과 가벼운 등급의 속도-힘 트레이드오프 도표

실제로 며칠 그렇게 써보니 손해가 없지는 않았다. 파일 하나가 어디 있는지 찾는 것 같은 단순 조회에도, 짧은 메모 하나를 정리해 달라는 잡무에도 전부 같은 등급을 쓰다 보니 대답이 나오기까지 매번 한참을 기다려야 했다. 큰 톱니바퀴일수록 힘은 세지만 도는 속도는 느리다는 걸, 그제야 몸으로 느꼈다. 간단한 일까지 전부 무거운 등급에 태우면서 기다리는 시간만 늘어났다.

가벼운 쪽으로 옮겨봤다가 걸린 것

그래서 방향을 바꿔봤다. 켜는 세션 거의 전부를 가벼운 등급 쪽으로 옮겼다. 대답은 확실히 빨랐다. 파일 조회나 짧은 확인 같은 건 오히려 이쪽이 훨씬 편했다.

완행차선(가벼운 등급)에 판단이 필요한 일을 태워 정체가 생긴 모습을 보여주는 3차선 도표

문제는 판단이 필요한 일에서 나타났다. 짧은 원고 하나를 여러 번 고쳐 쓰다가 방향을 다시 잡아야 하는 순간, 가벼운 등급은 눈에 보이는 대로만 답하고 다른 각도는 잘 짚어주지 못했다. 원인이 뭔지 애매한 문제를 물어봤을 때도 마찬가지였다. 빠르긴 한데, 그 속도가 무색하게 답은 겉돌았다. 붙잡고 있던 문제 자체가 가벼운 등급으로는 손이 안 닿는 종류였다.

모니터에 띄운 코드 편집 화면을 들여다보는 사람의 뒷모습 — 판단이 필요한 순간의 장면 컷

등급 세 가지, 지금 나누는 기준

두 번 다 방향을 잘못 잡았다는 걸 알고 나서, 지금은 작업 성격에 따라 세 가지로 나눠 쓴다.

크기가 다른 렌치 세 개가 각각 원인진단·글쓰기정리·단순조회 작업에 대응하는 공구함 도표

첫째, 무거운 등급은 원인을 찾거나 애매한 걸 판단해야 하는 일에만 쓴다. 왜 이런 결과가 나왔는지 짚어야 하거나, 여러 각도를 같이 봐야 하는 일, 정답이 하나로 정해져 있지 않은 일이다. 예를 들어 글 하나의 방향이 이상하게 흘러갈 때 “왜 이렇게 됐는지”를 되짚어보는 일은 이 등급에 맡긴다. 느리고 비용도 더 든다는 걸 알고 쓰는 거라, 그만큼 아무 데나 쓰지는 않는다.

둘째, 중간 등급은 평소 기본값이다. 정해진 절차를 따라가는 실행형 작업, 글을 쓰거나 문서를 정리하거나 요약하는 일은 대부분 이 등급으로 처리한다. 이미 방향이 잡힌 원고를 다듬거나, 회의 내용을 정리해 문서로 만드는 일이 여기 해당한다. 방향은 이미 정해져 있고 그걸 실제 결과물로 옮기기만 하면 되는 일이라, 속도와 품질의 균형이 셋 중 가장 낫다고 느꼈다.

셋째, 가벼운 등급은 단순 조회나 반복 작업에만 쓴다. 파일이 어디 있는지, 어제 뭘 적어뒀는지, 목록에서 하나를 찾아 확인하는 것 같은 일, 그리고 이미 정해진 형식에 값만 채워 넣는 반복 작업이 여기 해당한다. 가벼운 등급으로도 충분하고, 오히려 이쪽이 훨씬 빠르다. 세 등급을 나눠보니 결국 “판단이 필요한가, 손만 움직이면 되는가, 그냥 찾기만 하면 되는가”라는 질문 하나로 갈리는 셈이었다.

여기까지 정리한 기준

  • 판단이 필요한 일과 손을 움직이는 일을 먼저 구분한다. 등급은 그다음에 고른다.
  • 세션 안에서 쓰던 등급을 자주 바꾸는 것도 그만뒀다. 채팅 하나에서 등급을 오가면 그 위에 쌓여있던 대화 흐름이 뚝 끊기는 느낌을 받았고, 결과적으로 처음부터 다시 설명해야 하는 일이 잦았다.
  • 등급은 작업을 시작하기 전에 정한다. 작업 도중에 바꾸는 건 되도록 피한다.
  • 하나의 작업 안에서도 성격이 섞여 있으면, 가장 판단이 많이 필요한 부분을 기준으로 등급을 고른다. 절반은 단순 조회고 절반은 원인 진단이라면, 무거운 등급 하나로 처리하는 쪽이 결국 덜 헤맸다.
  • 무거운 등급이 늘 정답은 아니다. 셋 다 각자 자리가 있고, 그 자리를 찾는 데 시간이 좀 걸렸을 뿐이다.

숫자로 정밀하게 재본 기준은 아니다. 요금제 구성이 계속 바뀌는 편이라 등급별 정확한 차이는 이번 글에서 다루지 않았고, 지금 방식이 시간을 실제로 얼마나 아껴주는지도 정밀하게 재보진 않았다. 여기 적은 기준 세 가지도 감으로 잡은 것이라, 며칠 더 써보면 좀 더 다듬어질 여지가 있다고 본다.

다른 편도 함께 본다

이 시리즈의 다른 기록들도 남겨둔다. 나흘 걸렸던 첫 설치 과정은 클로드코드 설치, 터미널 화면 앞에서 나흘이 걸린 이유에 적혀 있고, 챗봇과는 뭐가 다른지 헤맸던 지점은 AI 에이전트, 챗봇과 뭐가 다른가에 정리해뒀다. 세션 다섯 개를 나눠 쓴 밤 얘기는 위에서 이미 링크했다. 등급을 나눠 쓰는 감이 손에 완전히 붙었다고는 못 하겠지만, 적어도 하나는 분명해졌다. 무거운 등급이 기본값이어야 할 이유는 없었다.

✍️ 글쓴이

두 아이를 키우는 직장인이다. 월급 밖에서 뭘 더 할 수 있을지 궁리하다가 AI 도구를 붙들게 됐고, 헤매면서 알게 된 것들을 정리해 남긴다. 잘된 것만 골라 쓰지 않고, 막혔던 과정도 그대로 적는다. 확인이 안 된 이야기는 확인 안 됐다고 밝힌다.

※ 등급별 속도·품질 차이와 등급 전환 시 맥락이 끊기는 현상은 Anthropic이 공개한 안내 내용과 이 글쓴이가 실제로 써보며 겪은 것만 담았습니다. 가격이나 세부 성능 수치처럼 요금제마다 달라지는 값은 이 글에서 다루지 않았습니다.

#AI등급 #클로드코드 #AI활용 #직장인부업 #직탈랩

― 직탈랩 AI 실험 시리즈 ―

이 글은 세션 다섯 개를 나눠 쓰던 경험에서 이어지는, AI 등급을 나눠 쓰는 감에 관한 기록입니다.

▶ 전체 글: 직탈랩 블로그 홈 · 직탈랩 워드프레스 홈

코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다