Kitta AI Docs
Guías de integraciónIntegraciones de terceros
Back to site

Configuración del agente Hermes

Configure Hermes Agent para generar archivos de voz a través del punto final Kitta AI compatible con OpenAI.

Conecte Kitta AI TTS al Agente Hermes

Hermes Agent puede utilizar una URL base personalizada para su proveedor OpenAI TTS integrado. Esto conecta la herramienta text_to_speech a Kitta AI sin cambiar el modelo de lenguaje que impulsa a Hermes.

No agregue este punto final a los proveedores de modelos de Hermes. Kitta AI expone la generación de voz en /v1/audio/speech, no el punto final /v1/chat/completions requerido por un modelo de chat.

Antes de empezar

Necesitas:

  • Una clave Kitta AI API con créditos API
  • Una identificación de voz Kitta AI
  • Una instalación reciente del Agente Hermes.

Cree una clave API dedicada para Hermes para que pueda monitorearla o revocarla de forma independiente.

Agregue la clave API

Agregue la clave a ~/.hermes/.env:

VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEY

No coloque la clave en config.yaml, el historial del shell, las capturas de pantalla ni en un repositorio.

Configurar Kitta AI TTS

Agregue o actualice la sección tts en ~/.hermes/config.yaml:

tts:
  provider: openai
  speed: 1.0
  openai:
    base_url: 'https://kittaai.com/v1'
    model: fishaudio-s21pro-flash
    voice: 00a1b221-6137-4b73-ad62-b0cbce134167
    speed: 1.0

El ejemplo de ID de voz es un sistema público de voz para pruebas de conexión. Reemplácelo con su ID de voz Kitta AI preferido después de la primera solicitud exitosa.

Habilite y pruebe la herramienta

Ejecute hermes tools y asegúrese de que Voice & TTS esté habilitado. Inicie Hermes y pregunte:

Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Kitta AI test."

Hermes debería guardar un archivo MP3 en su directorio de salida de audio y devolver una ruta multimedia.

Limitación del canal de mensajería

Esta configuración está verificada para la generación de archivos MP3. Hermes puede solicitar salida nativa de Opus al entregar burbujas de voz de Telegram o Discord. El terminal compatible con Kitta AI OpenAI actualmente admite mp3, wav y pcm, por lo que esta configuración no admite la entrega nativa de burbujas de voz de Opus. Utilice un archivo adjunto MP3 o una capa de conversión para esos canales.

Solución de problemas

  • Hermes dice que no hay ninguna clave de audio OpenAI configurada: confirme que VOICE_TOOLS_OPENAI_KEY esté disponible para el proceso que inicia Hermes y luego reinícielo.
  • Las solicitudes aún llegan a OpenAI: confirme que tts.provider es openai y tts.openai.base_url es exactamente https://kittaai.com/v1.
  • Voz o modelo no válido: use ID de Kitta AI, no nombres de voz de OpenAI como alloy o nombres de modelos como tts-1.
  • 401: reemplaza la clave API faltante, no válida o revocada.
  • 402: agregue créditos API antes de volver a intentarlo.
  • La solicitud de Opus falla: solicita un archivo MP3 en lugar de una burbuja de voz de mensajería nativa.

Documentación relacionada