이 주제와 관련된미래 기술 및 AI 카운슬

앤트로픽 소네트 신모델, 오푸스급 성능…토큰 더 소모

  • 앤트로픽, 클로드 소네트 5.5 출시…5보다 30% 이상 빠르다 주장
  • 아티피셜 애널리시스 인텔리전스 인덱스 2위…1위 오퍼스 5.5
  • 최대 성능, 소네트 5.5 출력 토큰 60% 더 많다
Promo

앤트로픽(Anthropic)은 9월 28일, 소넷 5.5(Sonnet 5.5)를 소넷 5와 동일한 기준가에 출시했습니다. 회사 측은 이 모델이 30% 이상 더 빠르게 실행되며, 작업당 비용이 최대 30% 더 저렴하다고 밝혔습니다.

독립 벤치마킹 업체는 모델을 한계까지 테스트한 후 비용에 대해 다른 결론을 내렸습니다.

X에서 저희를 팔로우하시면 최신 뉴스를 빠르게 받아보실 수 있습니다

후원
후원

앤트로픽의 두 번째 5.5 모델, 오퍼스(Opus) 출시 며칠 만에 공개됩니다

소넷 5.5는 클로드(Claude) 5.5 제품군의 두 번째 모델입니다. 앤트로픽은 9월 22일 오퍼스 5.5를 출시했습니다. 같은 날, 오픈에이아이(OpenAI)도 GPT-6 솔(Sol)과 루나(Luna)를 공개했습니다.

신규 모델의 가격은 백만 입력 토큰당 2달러, 백만 출력 토큰당 10달러로 소넷 5와 동일하게 유지됩니다. 앤트로픽은 소넷 5가 터미널-벤치 4.0(Terminal-Bench 4.0) 에이전트 코딩 테스트에서 70.6%를 기록했다고 밝혔습니다. 소넷 5는 10.3%를 기록한 반면, 오퍼스 5.5는 66.4%에 도달했습니다.

“오퍼스 5.5는 세심한 판단이 필요한 복잡한 작업에 맞추어 제작된 반면, 소넷 5.5는 일상적인 범위가 명확한 과제, 버그 수정, 그리고 다듬어진 문서·슬라이드·스프레드시트 생성에 가장 강점을 보입니다.”라고 팀은 밝혔습니다.

후원
후원

앤트로픽은 소넷 5.5가 기존 역량의 한계를 확장하지는 않는다고 설명했습니다. 따라서 이번 정렬 검토는 사용자를 오도하거나 심각한 오용을 조장하는 위험에 집중했습니다.

소넷 5.5에는 사이버 보안 기능과 반(反)디스틸레이션 분류기도 탑재되어 있습니다. 경쟁 시스템 교육을 위한 모델 추론 추출 시도도 차단합니다. 클로드 하이쿠 5.5(Claude Haiku 5.5)는 수 주 내 출시될 예정입니다.

한편, 오픈에이아이는 차기 모델 GPT-6.1 아스트라(Astra) 공개를 안전 문제로 보류했습니다. CNBC는 월요일 이 모델이 회사 기준에 미치지 못했다고 전했습니다.

Artificial Analysis, 최대 성능에선 높은 토큰 소모량 확인합니다

그록(Grok) 4.7을 4위에 배치한 벤치마킹 업체 Artificial Analysis는 소넷 5.5에 인텔리전스 인덱스 56점을 부여했습니다. 이 점수는 전체 2위로, 오퍼스 5.5보다 2점 낮은 수준입니다.

해당 업체는 소넷 5.5가 터미널-벤치 4.0에서 64%를, 오퍼스 5.5와 GPT-6 아스트라는 60%를 기록했다고 발표했습니다. GDPval-AA 등의 지식 작업 테스트에서는 소넷 5.5가 오퍼스 5.5와 비슷한 수준임을 확인했습니다.

하지만 업체는 소넷 5.5가 이 같은 결과에 도달하기 위해 훨씬 더 많은 토큰을 사용했다고 밝혔습니다.

“최대 성능에서 오퍼스 5.5에 필적하는 성능을 보일 때, 클로드 소넷 5.5는 인텔리전스 인덱스 과제당 약 19만 3천 개의 출력 토큰을 사용했습니다.”라고 게시물은 설명했습니다.

이 토큰 양은 최대 성능 기준 오퍼스 5.5 및 소넷 5 대비 약 60% 높은 수치입니다. GPT-6 아스트라의 최대 성능 시보다도 약 7배 많습니다.

한편 앤트로픽이 인용한 초기 접근 고객들은, 서로 다른 업무 환경에서 소넷 5 대비 정반대 결과를 얻었다고 말했습니다. 발야스니 자산운용(Balyasny Asset Management)은 금융 업무에서 훨씬 적은 토큰 사용량을 경험했습니다.

“저희의 2,441건 금융 업무(Q&A, 추출, 분석, 예측) 전용 환경에서 클로드 소넷 5.5는 소넷 5보다 더 높은 점수를 받았고, 답변당 약 12만 1천 개의 토큰을 사용했습니다. 소넷 5는 49만 7천 개를 썼습니다.” – 조 포아리에(Joe Poirier), 발야스니 자산운용 선임 AI 엔지니어.

Artificial Analysis는 앤트로픽이 최근 수정한 구조적 출력 버그가 포함된 사전 공개 버전을 테스트했습니다. 이 업체는 조만간 재평가를 진행할 계획입니다.

유튜브 채널을 구독하시면 리더와 기자들이 전하는 전문가 견해를 보실 수 있습니다

부인 성명

BeInCrypto는 편향 없고 투명한 보도를 위해 최선을 다하고 있습니다. 본 뉴스 기사는 정확하고 시의적절한 정보를 제공하는 것을 목표로 합니다. 다만 독자께서는 본 콘텐츠를 근거로 어떠한 결정을 내리기 전에 사실을 독립적으로 확인하고 전문가와 상담하시기 바랍니다. 당사의 이용약관, 개인정보 처리방침 및 면책조항이 업데이트되었음을 알려드립니다.

후원
후원