feat: OCR y Whisper como herramientas opcionales por canal en uMind
Cada canal (Telegram/WhatsApp) de un agente ahora puede activar, de forma independiente, que los audios entrantes se transcriban con el Whisper ASR propio y que a las imágenes entrantes se les extraiga texto con el servicio OCR propio, antes de pasarle el mensaje al agente. Antes esos mensajes se ignoraban en silencio. - UmindCanal gana usar_whisper_audio/usar_ocr_imagenes (default off). - WhatsApp: se descarga el media vía Graph API (resolución de URL + fetch con el mismo access_token del canal) y se enruta a Whisper/OCR según type. - Telegram: se descarga el archivo vía getFile + CDN de archivos del bot, mismo enrutamiento para voice/audio/photo. - Panel: checkboxes en el alta de canal y toggles inline por canal ya creado, en la tab Canales del agente. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Sonnet 5
parent
d493d6dee6
commit
84506a98e2
@@ -28,6 +28,11 @@ type UmindCanal struct {
|
||||
WebhookSecret string `json:"webhook_secret" gorm:"column:webhook_secret;uniqueIndex;size:40;not null"`
|
||||
CredencialesEnc string `json:"-" gorm:"column:credenciales_enc;type:text"`
|
||||
UltimoError string `json:"ultimo_error" gorm:"column:ultimo_error;type:text"`
|
||||
// Si están activos, los mensajes de voz/audio e imágenes que llegan por
|
||||
// este canal se transcriben (Whisper) o se les extrae el texto (OCR)
|
||||
// antes de pasarlos al agente, en vez de ignorarse.
|
||||
UsarWhisperAudio bool `json:"usar_whisper_audio" gorm:"column:usar_whisper_audio;default:false"`
|
||||
UsarOcrImagenes bool `json:"usar_ocr_imagenes" gorm:"column:usar_ocr_imagenes;default:false"`
|
||||
}
|
||||
|
||||
func (UmindCanal) TableName() string { return "umind_canales" }
|
||||
|
||||
Reference in New Issue
Block a user