음성-텍스트 변환은 음성 오디오를 문자로 전사합니다. 오디오 파일을 /audio/transcriptions로 전송하고 전사 모델을 선택한 뒤 원하는 응답 형식을 지정하세요.
대화 녹음을 다루고 계신가요? 음성-텍스트 변환으로 회의록 만들기는 오디오 파일에서 시작해 합의된 시점(초 단위)을 인용하는 결정 사항과 실행 항목까지 다루며, 어떤 모델이 세그먼트 타이밍을 반환하는지, 화자가 누구인지 전혀 밝히지 않는 전사를 어떻게 처리하는지도 설명합니다.
기본 사용법
지원 입력
일반적인 오디오 형식으로는 mp3, mp4, mpeg, mpga, m4a, wav, webm, flac, ogg가 있습니다. 현재 모델 지원과 가격 정보는 음성-텍스트 모델 페이지를 참조하세요.
응답 형식
전사 결과를 미디어 재생과 함께 쓸 경우 자막 형식을 사용하세요. 요약, 검색 또는 후속 채팅 프롬프트로 전사 결과를 넘길 때는 json이나 text를 사용하세요.
프로덕션 팁
- 가능하면 오디오를 선명하게 유지하고 화자가 겹치지 않도록 하세요.
- 워크플로에 낮은 지연 시간이나 손쉬운 재시도가 필요하다면 매우 긴 녹음을 더 작은 청크로 분할하세요.
- 감사 추적을 위해 각 전사 결과와 함께 원본 오디오 경로, 모델 ID, 응답 형식을 저장하세요.
관련 리소스