콘텐츠로 이동

TranscribeAudio

어떤 노드인가요?

TranscribeAudio 노드는 OpenAI의 모델을 사용하여 오디오를 텍스트로 변환합니다. 여러 음성 변환 모델을 지원하며 직접 모델을 구성하거나 에이전트 기반의 텍스트 변환을 수행할 수 있습니다.

언제 사용하나요?

다음과 같은 경우에 이 노드를 사용합니다:

  • 음성을 텍스트로 변환할 때
  • 오디오 녹음 파일을 텍스트로 받아 적을 때
  • 오디오 파일에서 텍스트를 추출할 때
  • 음성 입력을 서면 형태로 처리할 때
  • 오디오 콘텐츠의 스크립트(Transcript)를 생성할 때

사용 방법

기본 설정

  1. 워크플로에 TranscribeAudio 노드를 추가합니다.
  2. "audio" 입력에 오디오 소스를 연결합니다.
  3. 음성 변환 모델을 선택하거나 에이전트를 연결합니다.
  4. 노드를 실행하여 텍스트 변환 결과를 생성합니다.

파라미터 (Parameters)

  • agent: 텍스트 변환에 사용할 선택적 기존 에이전트 구성
  • model: 사용할 음성 변환 모델 (기본값: "gpt-4o-mini-transcribe")
  • audio: 텍스트로 변환할 오디오 파일 (필수)
  • output: 변환된 텍스트 출력

출력 (Outputs)

  • output: 오디오에서 변환된 텍스트
  • agent: 텍스트 변환에 사용된 에이전트 객체 (다른 노드에 연결 가능)

예시

오디오를 녹음하고 텍스트로 변환하는 전체 워크플로:

  1. 오디오를 캡처할 Microphone 노드를 추가합니다.
  2. Microphone의 "audio" 출력을 TranscribeAudio 노드의 "audio" 입력에 연결합니다.
  3. 원하는 음성 변환 모델을 선택합니다.
  4. 워크플로를 실행합니다.
  5. "output" 파라미터에서 변환된 텍스트를 확인할 수 있습니다.

중요 참고 사항

  • 이 노드는 환경 변수에 OPENAI_API_KEY로 설정된 유효한 OpenAI API 키가 필요합니다.
  • 사용 가능한 모델:
    • gpt-4o-mini-transcribe
    • gpt-4o-transcribe
    • whisper-1
  • 더욱 맞춤화된 동작을 위해 자체 에이전트 구성을 제공할 수 있습니다.
  • 변환 품질은 오디오 음질 및 선택한 모델에 따라 달라집니다.

자주 묻는 질문 및 문제 해결

  • API 키 누락: 환경 변수에 OpenAI API 키가 올바르게 설정되어 있는지 확인하세요.
  • 오디오 미제공: "audio" 입력에 유효한 오디오 소스가 연결되어 있는지 확인하세요.
  • 변환 품질 불량: 다른 모델을 사용하거나 오디오 음질을 개선해 보세요.
  • 처리 오류: 오디오 파일이 매우 길거나 음질이 좋지 않으면 정확도가 떨어질 수 있습니다.