Configuración del agente Hermes
Configure Hermes Agent para generar archivos de voz a través del punto final Kitta AI compatible con OpenAI.
Conecte Kitta AI TTS al Agente Hermes
Hermes Agent puede utilizar una URL base personalizada para su proveedor OpenAI TTS integrado. Esto conecta la herramienta text_to_speech a Kitta AI sin cambiar el modelo de lenguaje que impulsa a Hermes.
No agregue este punto final a los proveedores de modelos de Hermes. Kitta AI expone la generación de voz en
/v1/audio/speech, no el punto final/v1/chat/completionsrequerido por un modelo de chat.
Antes de empezar
Necesitas:
- Una clave Kitta AI API con créditos API
- Una identificación de voz Kitta AI
- Una instalación reciente del Agente Hermes.
Cree una clave API dedicada para Hermes para que pueda monitorearla o revocarla de forma independiente.
Agregue la clave API
Agregue la clave a ~/.hermes/.env:
VOICE_TOOLS_OPENAI_KEY=YOUR_FISH_AUDIO_API_KEYNo coloque la clave en config.yaml, el historial del shell, las capturas de pantalla ni en un repositorio.
Configurar Kitta AI TTS
Agregue o actualice la sección tts en ~/.hermes/config.yaml:
tts:
provider: openai
speed: 1.0
openai:
base_url: 'https://kittaai.com/v1'
model: fishaudio-s21pro-flash
voice: 00a1b221-6137-4b73-ad62-b0cbce134167
speed: 1.0El ejemplo de ID de voz es un sistema público de voz para pruebas de conexión. Reemplácelo con su ID de voz Kitta AI preferido después de la primera solicitud exitosa.
Habilite y pruebe la herramienta
Ejecute hermes tools y asegúrese de que Voice & TTS esté habilitado. Inicie Hermes y pregunte:
Use the text_to_speech tool to create an MP3 file that says:
"Hello, this is a Kitta AI test."Hermes debería guardar un archivo MP3 en su directorio de salida de audio y devolver una ruta multimedia.
Limitación del canal de mensajería
Esta configuración está verificada para la generación de archivos MP3. Hermes puede solicitar salida nativa de Opus al entregar burbujas de voz de Telegram o Discord. El terminal compatible con Kitta AI OpenAI actualmente admite mp3, wav y pcm, por lo que esta configuración no admite la entrega nativa de burbujas de voz de Opus. Utilice un archivo adjunto MP3 o una capa de conversión para esos canales.
Solución de problemas
- Hermes dice que no hay ninguna clave de audio OpenAI configurada: confirme que
VOICE_TOOLS_OPENAI_KEYesté disponible para el proceso que inicia Hermes y luego reinícielo. - Las solicitudes aún llegan a OpenAI: confirme que
tts.provideresopenaiytts.openai.base_urles exactamentehttps://kittaai.com/v1. - Voz o modelo no válido: use ID de Kitta AI, no nombres de voz de OpenAI como
alloyo nombres de modelos comotts-1. - 401: reemplaza la clave API faltante, no válida o revocada.
- 402: agregue créditos API antes de volver a intentarlo.
- La solicitud de Opus falla: solicita un archivo MP3 en lugar de una burbuja de voz de mensajería nativa.