AI·자동화

메타 Muse Spark 1.3 출시|긴 작업·코딩·가격은 GPT·Claude보다 나을까?

AI 코딩 도구를 오래 쓰다 보면 모델의 순간적인 코딩 실력보다 더 답답한 문제가 생깁니다. 처음에는 요구사항을 잘 따라가다가 작업이 길어지면 앞에서 정한 조건을 잊거나, 이미 확인한 파일을 다시 뒤지기 시작하죠.

메타가 9월 2일 공개한 Muse Spark 1.3은 이런 장시간 작업과 코딩 효율을 집중적으로 개선했습니다. Muse Code 구독제까지 추가되면서 이제 GPT·Codex와 Claude Code를 쓰는 개발자라면 성능뿐 아니라 가격까지 비교해볼 만한 선택지가 됐습니다.

Muse Spark 1.3은 긴 작업에 초점을 맞췄습니다

Muse Spark 1.3의 긴 작업 유지력을 설명하는 워크플로우 이미지
긴 코딩 작업에서는 앞 조건을 유지하고 애매한 지시를 구분하는 능력이 중요합니다.

이번 업데이트에서 메타가 가장 강조한 부분은 단순 코드 생성 능력이 아닙니다.

여러 작업이 뒤섞인 긴 대화에서도 새 요청이 어느 작업에 속하는지 구분하고, 애매한 지시는 먼저 질문하도록 개선됐습니다. 스스로 막혔다고 판단하면 도움을 요청하고, 되돌리기 어려운 행동은 실행 전에 사용자에게 확인합니다.

예를 들어 저장소 전체를 분석하고 버그를 찾은 뒤 여러 파일을 수정하고 테스트까지 맡기는 작업을 생각하면 쉽습니다.

이런 작업에서는 한 번 코드를 잘 만드는 것보다 앞의 조건을 얼마나 오래 유지하는지가 실제 생산성을 크게 좌우합니다.

벤치마크는 긴 컨텍스트와 코딩에서 강합니다

Muse Spark 1.3의 긴 컨텍스트와 코딩 벤치마크 강점을 보여주는 이미지
벤치마크에서는 긴 컨텍스트와 코드베이스 작업에서 강점이 두드러집니다.

메타가 공개한 자료에서 비교 대상을 세 모델로 좁히면 특징이 더 잘 보입니다.

눈에 띄는 부분은 긴 컨텍스트입니다. MRCR 256K~512K에서 98.5, 512K~1M에서는 98.1을 기록해 GPT-5.6 Sol보다 높은 결과를 냈습니다.

코딩에서도 DeepSWE와 SWEAtlas CodeBase QnA에서 비교 모델을 앞섰고, Terminal-Bench에서는 GPT-5.6 Sol과 같은 88.8을 기록했습니다.

하지만 에이전트 영역에서는 결과가 엇갈립니다. DeepSearchQA와 지시 이행에서는 GPT가 높았고, JobBench·OSWorld·AutomationBench에서는 Claude Opus 5가 앞섰습니다.

따라서 “GPT·Claude를 이겼다”기보다 긴 컨텍스트와 코드베이스 작업에서 경쟁력이 크게 올라왔다고 보는 편이 정확합니다.

구분벤치마크Muse Spark 1.3 MaxGPT-5.6 Sol MaxClaude Opus 5 Max
AgentGDPVal-AA v2175417101824
AgentJobBench64.945.465.7
AgentOSWorld 2.066.962.768.3
AgentDeepSearchQA89.493.090.4
AgentAgentic IF Index57.860.559.1
AgentAutomationBench49.446.750.3
Long ContextMRCR 256K-512K98.591.5
Long ContextMRCR 512K-1M98.173.8
CodingDeepSWE v1.175.473.074.0
CodingSWEAtlas CodeBase QnA59.453.552.7
CodingTerminal-Bench 2.188.888.886.7

실제 코딩에서는 토큰과 도구 호출도 줄었습니다

Muse Spark 1.3의 도구 호출과 토큰 사용량 감소를 보여주는 이미지
도구 호출과 토큰 사용량 감소는 긴 작업의 시간과 비용에 영향을 줍니다.

에이전트형 코딩에서는 결과 하나를 만들기까지 AI가 얼마나 헤매는지도 중요합니다.

메타 엔지니어들의 비교에서 Muse Spark 1.3은 이전 버전보다 도구 호출 약 20%, 토큰 사용량은 약 25% 감소했습니다. 불필요한 대화 턴도 줄이고 코드 스타일도 정리했다고 설명합니다.

파일 검색과 명령 실행을 반복하는 장시간 코딩에서는 이런 차이가 곧 작업시간과 비용 차이로 이어질 수 있습니다.

특히 API를 직접 연결한다면 토큰 사용량 자체가 비용이므로, 낮은 단가와 적은 토큰 사용량이 함께 작용할 가능성이 있습니다.

가격은 API와 월 구독제를 따로 봐야 합니다

Muse Code ChatGPT Claude 월 요금을 비교한 가격표 이미지
Spark 1.3을 보려면 Muse High $15 플랜부터 비교하는 편이 현실적입니다.

Muse Spark 1.3은 이전 버전과 동일한 API 가격을 유지합니다. Muse Spark의 일반 API 가격은 입력 100만 토큰당 $1.25, 출력은 $4.25 수준입니다.

같은 토큰을 사용한다고 단순 비교하면 Muse Spark 1.3의 가격은 상당히 공격적입니다.

다만 개인 개발자는 API보다 월 구독료를 더 중요하게 볼 가능성이 큽니다. Codex는 ChatGPT 구독에 포함되고 Claude Code 역시 Claude 유료 플랜에서 사용할 수 있기 때문입니다.

Muse Code의 Everyday는 월 $5이지만 Spark 1.2가 명시돼 있습니다. 반면 High는 최신 모델 접근이 포함되므로 Muse Spark 1.3을 목적으로 가입한다면 현실적으로 월 $15 플랜부터 비교하는 편이 낫습니다.

그러면 ChatGPT Plus와 Claude Pro의 월 $20보다 약간 저렴합니다. 사용량이 많아질수록 Muse Power $50과 경쟁사의 $100~$200 플랜 사이 가격 차이도 커집니다.

모델입력 100만 토큰출력 100만 토큰
Muse Spark 1.3$1.25$4.25
GPT-5.6 Sol$4.00$20.00
Claude Opus 5$5.00$25.00
서비스월 요금특징
Muse Code Everyday$5Spark 1.2, 5시간당 약 10~50회
Muse Code High$15Everyday 3배 사용량, 최신 모델 접근
ChatGPT Plus$20Codex 포함
Claude Pro$20Claude Code 포함
Muse Code Power$50Everyday 10배 사용량
ChatGPT Pro$100 / $200Plus 대비 5x / 20x 사용량
Claude Max$100 / $200Pro 대비 5x / 20x 사용량

VS Code에서는 Muse Spark 1.3을 어떻게 사용할까?

VS Code에서 Muse Code CLI를 사용하는 흐름 이미지
Muse Code는 VS Code 안의 터미널에서 프로젝트를 맡기는 방식으로 이해할 수 있습니다.

Claude Code와 Codex를 VS Code에서 사용하는 개발자라면 이 부분도 중요합니다.

현재 Muse Code는 VS Code용 공식 확장 프로그램보다 터미널 중심의 코딩 에이전트에 가깝습니다. Meta가 공식 안내하는 설치 환경은 macOS와 Linux이며, 설치 명령은 다음과 같습니다.

curl -fsSL https://dev.meta.ai/install.sh | bash

그렇다고 VS Code를 따로 닫을 필요는 없습니다.

VS Code에서 작업할 프로젝트 폴더를 연 뒤 Terminal → New Terminal을 실행하고, 해당 터미널에서 Muse Code를 실행하면 됩니다.

사용 흐름은 다음처럼 생각하면 쉽습니다.

VS Code에서 프로젝트 열기
        ↓
Integrated Terminal 실행
        ↓
Muse Code 실행
        ↓
"이 프로젝트의 로그인 오류 원인을 찾아서 수정해줘"
        ↓
Muse가 파일 분석 → 수정 → 명령 실행 → 검증
        ↓
VS Code에서 변경된 코드 확인

즉 Claude Code처럼 VS Code 안의 터미널에서 프로젝트 전체를 맡기는 방식입니다.

현재 Meta 공식 VS Code 확장 프로그램은 확인되지 않기 때문에, 서드파티 확장 프로그램보다 공식 Muse Code CLI를 사용하는 편이 안전합니다.

또한 Windows 네이티브 지원은 공식 설치 안내에서 명확하게 확인되지 않으므로 Windows 사용자는 지원 환경을 먼저 확인하는 것이 좋습니다.

그렇다면 GPT·Claude에서 갈아탈 만할까요?

현재 결과만 보고 기존 구독을 바로 끊을 단계는 아닙니다.

ChatGPT Plus는 Codex뿐 아니라 일반 ChatGPT 기능을 함께 사용할 수 있고, Claude Pro 역시 Claude Code 외에 Claude의 다른 기능이 포함됩니다. Muse Code와 단순 월 이용료만 비교하면 조건이 완전히 같지는 않습니다.

반면 코딩 에이전트가 주목적이라면 Muse Code는 꽤 흥미롭습니다.

대형 저장소를 읽고 여러 파일을 수정하거나, 한 작업을 오래 맡기는 개발자라면 Muse Spark 1.3의 벤치마크 방향과도 잘 맞습니다.

가장 정확한 비교는 같은 프로젝트에 같은 요구사항을 주는 것입니다. 결과 품질과 함께 작업시간, 재수정 횟수, 실패 횟수까지 비교하면 됩니다.

결국 Muse Spark 1.3의 경쟁력은 벤치마크 1등 여부만으로 결정되지 않습니다.

GPT·Claude와 비슷한 품질을 월 $15~50 수준에서 얼마나 오래 유지할 수 있느냐. 실제 개발자에게는 이 부분이 더 중요한 평가 기준이 될 가능성이 큽니다.

확인할 점

AI 모델 성능과 가격, 사용량 조건은 서비스 정책 변경에 따라 달라질 수 있습니다. 실제 선택 전에는 각 서비스의 공식 가격 페이지와 지원 환경을 다시 확인해야 합니다.

자주 묻는 질문

Muse Spark 1.3이 GPT-5.6 Sol보다 코딩을 잘하나요?

일부 테스트에서는 앞섭니다. DeepSWE와 코드베이스 이해, 긴 컨텍스트에서는 Muse Spark 1.3이 높은 결과를 기록했지만 모든 에이전트 벤치마크에서 우위인 것은 아닙니다.

Muse Spark 1.3을 월 5달러에 사용할 수 있나요?

1.3을 목적으로 한다면 $15 플랜을 보는 편이 낫습니다. Everyday $5는 Spark 1.2가 명시돼 있고, High $15부터 최신 모델 접근을 제공합니다.

VS Code에 Muse Code 확장 프로그램이 있나요?

Meta 공식 VS Code 확장 프로그램은 현재 확인되지 않습니다. 대신 VS Code의 Integrated Terminal에서 공식 Muse Code CLI를 실행하면 프로젝트를 그대로 작업할 수 있습니다.

Claude Code는 VS Code에서 직접 사용할 수 있나요?

네. Claude Code는 VS Code 계열 IDE에서 사용할 수 있어 에디터와 함께 작업하기 편합니다.

Codex도 ChatGPT Plus에 포함되나요?

네. 현재 Codex는 ChatGPT 유료 플랜에 포함돼 있어 별도의 API 비용 없이 정해진 사용량 안에서 이용할 수 있습니다.

참고한 자료