TranscribeAudio
어떤 노드인가요?
TranscribeAudio 노드는 OpenAI의 모델을 사용하여 오디오를 텍스트로 변환합니다. 여러 음성 변환 모델을 지원하며 직접 모델을 구성하거나 에이전트 기반의 텍스트 변환을 수행할 수 있습니다.
언제 사용하나요?
다음과 같은 경우에 이 노드를 사용합니다:
- 음성을 텍스트로 변환할 때
- 오디오 녹음 파일을 텍스트로 받아 적을 때
- 오디오 파일에서 텍스트를 추출할 때
- 음성 입력을 서면 형태로 처리할 때
- 오디오 콘텐츠의 스크립트(Transcript)를 생성할 때
사용 방법
기본 설정
- 워크플로에 TranscribeAudio 노드를 추가합니다.
- "audio" 입력에 오디오 소스를 연결합니다.
- 음성 변환 모델을 선택하거나 에이전트를 연결합니다.
- 노드를 실행하여 텍스트 변환 결과를 생성합니다.
파라미터 (Parameters)
- agent: 텍스트 변환에 사용할 선택적 기존 에이전트 구성
- model: 사용할 음성 변환 모델 (기본값: "gpt-4o-mini-transcribe")
- audio: 텍스트로 변환할 오디오 파일 (필수)
- output: 변환된 텍스트 출력
출력 (Outputs)
- output: 오디오에서 변환된 텍스트
- agent: 텍스트 변환에 사용된 에이전트 객체 (다른 노드에 연결 가능)
예시
오디오를 녹음하고 텍스트로 변환하는 전체 워크플로:
- 오디오를 캡처할 Microphone 노드를 추가합니다.
- Microphone의 "audio" 출력을 TranscribeAudio 노드의 "audio" 입력에 연결합니다.
- 원하는 음성 변환 모델을 선택합니다.
- 워크플로를 실행합니다.
- "output" 파라미터에서 변환된 텍스트를 확인할 수 있습니다.
중요 참고 사항
- 이 노드는 환경 변수에
OPENAI_API_KEY로 설정된 유효한 OpenAI API 키가 필요합니다. - 사용 가능한 모델:
- gpt-4o-mini-transcribe
- gpt-4o-transcribe
- whisper-1
- 더욱 맞춤화된 동작을 위해 자체 에이전트 구성을 제공할 수 있습니다.
- 변환 품질은 오디오 음질 및 선택한 모델에 따라 달라집니다.
자주 묻는 질문 및 문제 해결
- API 키 누락: 환경 변수에 OpenAI API 키가 올바르게 설정되어 있는지 확인하세요.
- 오디오 미제공: "audio" 입력에 유효한 오디오 소스가 연결되어 있는지 확인하세요.
- 변환 품질 불량: 다른 모델을 사용하거나 오디오 음질을 개선해 보세요.
- 처리 오류: 오디오 파일이 매우 길거나 음질이 좋지 않으면 정확도가 떨어질 수 있습니다.