문서

모델

모델은 생성되는 오디오의 품질, 지연 시간, 지원 언어 범위를 결정합니다.

개요

모든 IntuneVoice 기능은 전용 모델로 구동됩니다. 음성 합성 모델은 텍스트를 오디오로, 음성 인식 모델은 오디오를 텍스트로 변환합니다. 각 모델은 표현력, 지연 시간, 지원 언어 범위 간에 절충 관계가 있으므로 워크로드에 따라 적합한 모델이 달라집니다.

음성 합성

합성 모델은 텍스트를 자연스럽고 사람다운 음성으로 생성합니다. 날레이션과 장문 콘텐츠에는 고품질 모델을, 최대 표현력보다 실시간 지연 시간이 더 중요한 경우에는 더 빠른 모델을 사용하세요.

Model적합한 용도언어
intune_v3표현력 풍부한 다중 화자 연기70+
intune_multilingual_v2안정적인 장문 날레이션29
intune_flash_v2_5실시간 저지연 처리32

음성 인식

인식 모델은 음성 오디오를 타임스탬프가 포함된 정확한 텍스트로 전사합니다. scribe_v2 는 90개 이상의 언어에서 화자 분리와 동적 오디오 태깅을 통해 최고 수준의 정확도를 제공합니다. scribe_v2_realtime.

scribe_v2
scribe_v2_realtime

모델 선택

  • 품질과 감정을 우선한다면: 가장 표현력이 뛰어난 합성 모델을 선택하세요.
  • 지연 시간을 우선한다면: Flash 합성 모델이나 실시간 인식 모델을 사용하세요.
  • 대규모 사용 비용을 우선한다면: Flash 모델이 API 생성 시 문자당 가격을 낮춰줍니다.

모델 식별자는 대시보드나 API에서 생성을 요청할 때 전달합니다. 지원되는 모델 목록과 매개변수는 기능별 가이드를 참조하세요.

이 페이지가 도움이 되었나요?

제작 도구:IntuneVoice