한 시간 전
Anthropic, Claude Fable 5.1 출시…Fable 5 벤치마크 점수 두 배 이상
Anthropic Ships Claude Fable 5.1, More Than Doubling Its Predecessor on Key Benchmark
Decrypt

Anthropic은 화요일 Claude Fable 5.1과 Claude Mythos 5.1을 출시했다. 이번 출시는 Fable 5가 6월 9일 출시된 이후 Mythos 계열 모델에 대한 첫 업데이트였다. Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록했다. Fable 5는 해당 벤치마크에서 24.7%를 기록했다. Opus 5는 29.0%를 기록했다. Terminal-Bench-Science 0.1은 AI 에이전트가 명령줄 환경에서 과학 연구 과제를 수행할 수 있는지를 측정한다. Fable 5.1은 Terminal-Bench 4.0에서 55.8%를 기록했다. Fable 5는 해당 테스트에서 42.0%를 기록했다. Opus 5는 52.3%를 기록했다. Mythos 5.1은 사이버보안 필터를 완화한 조건에서 Terminal-Bench 4.0에서 60.9%를 기록했다. Anthropic은 자사의 안전장치가 일부 작업을 가로채 Opus 4.8로 재전송했다고 밝혔다. Fable 5.1은 외부 도구 없이 Humanity's Last Exam에서 60.9%를 기록했다. Fable 5.1은 외부 도구를 사용했을 때 65.0%를 기록했다. Anthropic은 이 모델이 학술 목적에 가장 진보한 모델이라고 밝혔다. Anthropic은 새 모델들이 코딩과 지식 업무를 위한 세계에서 가장 진보한 모델이라고 주장했다. Anthropic에 따르면 Fable 5.1과 Mythos 5.1은 서로 다른 안전 필터를 적용한 동일한 기반 모델을 사용한다. Fable 5.1은 Claude 계정이 있는 누구에게나 일반 제공된다. Mythos 5.1은 Anthropic의 Cyber Verification Program과 Life Sciences Verification Program을 통해 검증된 사이버보안 및 생명과학 전문가로 이용이 제한된다. 이 프로그램들은 Mythos 5에 대한 접근을 제한했던 Project Glasswing 접근 경로를 대체했다. Fable 5.1은 Pro 요금제와 일반 Team 또는 Enterprise 좌석에서 종량제 사용 크레딧을 차감한다. Fable 5.1은 해당 요금제의 주간 한도에 포함되지 않는다. Max 요금제와 프리미엄 Team 또는 Enterprise 좌석에는 주간 사용량의 최대 50%까지 Fable 5.1이 포함된다. Fable 5.1의 비용은 입력 토큰당 $10, 출력 토큰당 $50이다. Opus 5의 비용은 입력 토큰당 $5, 출력 토큰당 $25이다. Anthropic은 Fable 5.1에서 낮거나 중간 수준의 추론 강도를 사용하면 더 낮은 비용으로 Fable 5의 이전 결과와 맞먹거나 이를 능가할 수 있다고 밝혔다. Fable 5.1은 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry를 통해 이용할 수 있다. 모델 ID는 claude-fable-5-1이다.
This content is an AI-generated summary/analysis for informational purposes only and does not constitute investment advice.