AiHummer
Español
Iniciar sesiónCuenta
v1.2.x
{ }Swagger

Traducción de habla y video

v1.2.x · actualizada 2026-07-05

Más allá hablar dentro y fuera, AiHummer ofrece dos capacidades adicionales de medios: traducción de discurso y comprensión de video. Ambos funcionan con motores gratuitos/locales: la traducción se ensambla a partir de los sidecars de STT/TTS y el LLM que ya tienes, mientras que el video se ejecuta por sí mismo sidecar alcanzado por URL.

[!NOTE] La diarización del hablante y la clonación de voz son no parte del producto — esos las capacidades fueron eliminadas. Si las viste en material antiguo, no planees alrededor de ellos: la pila de voz es STT, TTS, el turno de voz (/v1/voice/turn), traducción de discursos y comprensión de videos.

Traducción de discurso

La traducción de voz convierte el audio en un idioma en audio hablado en otro, de modo que un agente puede atender a los llamantes en diferentes idiomas. Es un tubería de traducción pura sin turno de agente: el audio entrante se transcribe (STT), el texto se traduce con una finalización de LLM de una sola vez, y la traducción se reproduce en voz (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

No se necesita un sidecar adicional: la canalización utiliza los mismos sidecars gratuitos/locales que el turno de voz — faster-whisper (:8001) y edge-tts (:8002) — además de su proveedor de LLM configurado.

Artículo Valor
Punto final POST /v1/voice/translate?target=<lang>
target parámetro Idioma de destino (BCP-47 o un nombre de idioma simple); requerido
entrada Audio en el cuerpo de la solicitud (Content-Type, por defecto a audio/ogg)
Salida Audio traducido (audio/mpeg)
Encabezados de respuesta X-Voice-Transcript — texto fuente, X-Voice-Reply — la traducción
Requiere Proveedor de STT, TTS y un LLM configurado
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Comprensión de video

La comprensión de videos extrae lo que contiene un clip mediante la demultiplexación del audio y el muestreo de fotogramas clave con ffmpeg — hay sin modelo de ML en este sidecar; prepara audio y fotogramas para el turno del agente.

Artículo Valor
Respaldado por ffmpeg (demultiplexar + fotogramas clave, sin ML)
Puerto de sidecar :8005
Punto final POST /v1/video/understand
Conectado con AIHUMMER_VIDEO_URL

Cableado

La traducción de voz no necesita una variable dedicada: está activa una vez que se configuran STT, TTS y un proveedor de LLM. La comprensión de video se habilita mediante su URL de acompañamiento — una configuración del catálogo configuras desde la interfaz de administración (Gestión → Configuración) o con aihummer settings set (gateway.env es solo para bootstrap y se ignora para ello); el instalador nativo del host puede proveerlo, o señalar a una instancia que ya ejecutes.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Las capacidades son independientes: habilita solo las que necesites. Una implementación eso que solo necesita transcripción y síntesis puede ejecutar el par STT/TTS solo y deja el video sidecar sin configurar.

¿A dónde vamos ahora?