구글, 최첨단 오디오 모델 공개…성능 순위는

  • 구글 신규 음성 모델, 인공지능 분석 음성 지수 82.6 기록
  • Gemini 3.8 라이브 시간당 $0.84, 인덱스 최저 오디오 모델
  • 블라인드 음성 테스트, 구버전 제미니 3.1 플래시 라이브 선호
Promo

Google은 9월 15일 “제미나이 3.8 라이브”와 “제미나이 3.8 라이브 익스텐디드 띵킹”을 출시했습니다. 두 모델은 지금까지 가장 진보된 오디오 모델이라고 발표했습니다.

이 두 모델은 대화를 하고, 추론하며, 다양한 과제를 처리합니다. 독립 분석가들은 이 모델들을 어떻게 평가합니까? 익스텐디드 띵킹 버전은 “아티피셜 애널리시스”의 스피치-투-스피치 인덱스에서 82.6점을 받아 GPT-라이브-1과 그록 보이스를 앞섰습니다.

후원
후원

X에서 실시간으로 최신 뉴스를 확인하십시오

벤치마크는 구글의 최신 대화형 AI 모델을 어떻게 평가합니까

아티피셜 애널리시스의 인덱스는 음성 추론, 에이전트 성능, 아레나 선호도, 과제 성공률 평균치를 산출합니다.

“제미나이 3.8 라이브 익스텐디드 띵킹”은 높은 추론 노력 조건에서 테스트되어 1위를 차지했습니다. “GPT-라이브-1 아스트라”가 81.5점, “그록 보이스 띵크 패스트 2.0 하이”가 81.3점으로 뒤를 이었습니다.

제미나이 3.8 라이브 스피치-투-스피치 인덱스 순위
제미나이 3.8 라이브 스피치-투-스피치 인덱스 순위. 출처: 아티피셜 애널리시스

표준 “제미나이 3.8 라이브”는 76.0점으로 5위를 기록했습니다. 두 변형 모델 모두 “제미나이 3.1 플래시 라이브 하이”의 71.5점보다 높았습니다.

에이전트 성능 격차는 더 큽니다. 익스텐디드 띵킹은 타우 보이스 벤치마크에서 68.6%를 기록했으며, 이전 세대 모델은 37.7%였습니다.

후원
후원

음성 추론 벤치마크에서는 익스텐디드 띵킹이 97.7%를 획득해 그록 보이스(97.2%)를 근소하게 앞섰습니다. 그러나 쿤 오디오 3.0 리얼타임 플러스가 99.2%를 기록해 앞섰습니다.

인간 테스터는 여전히 이전 제미나이 모델을 선호합니다

가격에선 더 큰 차이가 나타납니다. 표준 모델은 입력 오디오 1시간당 0.84달러가 소요됩니다. 이 금액은 이전 세대의 1.75달러의 절반 수준이며, 인덱스에서 가장 저렴한 가격입니다.

익스텐디드 띵킹의 시간당 사용료는 3.50달러입니다. 이는 GPT-라이브-1 솔의 4.47달러와 그록 보이스 띵크 패스트 2.0 하이의 4.80달러보다 저렴합니다.

지연 시간도 줄었습니다. 첫 번째 오디오 생성까지 걸린 평균 시간은 1.18초로 단축되었습니다. 기존 제미나이 모델은 2.99초가 소요됐습니다.

하지만 청취자들은 완전히 만족하지 않습니다. “제미나이 3.1 플래시 라이브”는 블라인드 스피치 에이전트 아레나 대화에서 아직도 선호도가 가장 높으며, Elo 점수는 1096점입니다.

“제미나이 3.8 라이브”는 1083점으로 2위입니다. 익스텐디드 띵킹 변형은 89.1% 과제 완료율에도 불구하고 990점으로 뒤처졌습니다.

음성 AI는 현재 서로 다른 방향을 가리키는 두 척도로 평가를 받습니다. 벤치마크는 가장 깊이있는 추론 모델에 보상을 줍니다. 선호도는 더 설득력 있게 말하는 모델에 점수를 줍니다. 구글은 현재 각기 다른 모델로 두 영역 모두 선도하고 있습니다.

YouTube 채널을 구독하시면 전문가의 인사이트와 리더, 기자들의 해설을 시청하실 수 있습니다

부인 성명

BeInCrypto는 편향 없고 투명한 보도를 위해 최선을 다하고 있습니다. 본 뉴스 기사는 정확하고 시의적절한 정보를 제공하는 것을 목표로 합니다. 다만 독자께서는 본 콘텐츠를 근거로 어떠한 결정을 내리기 전에 사실을 독립적으로 확인하고 전문가와 상담하시기 바랍니다. 당사의 이용약관, 개인정보 처리방침면책조항이 업데이트되었음을 알려드립니다.

후원
후원