fix: el crawler de uMind acepta texto plano/Markdown, no solo HTML

CrawlearSitio rechazaba cualquier Content-Type que no contuviera
"text/html", así que una URL como base-conocimiento.md (text/plain, pensada
explícitamente para que la consuma una IA) fallaba con "no se pudo extraer
texto de ninguna página" pese a tener contenido perfectamente válido. Ahora
acepta text/plain, text/markdown, o cualquier URL terminada en .md, usando
el body tal cual sin pasarlo por el parser de HTML.

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
Lizandro Guarnizo
2026-08-12 20:51:47 -05:00
co-authored by Claude Sonnet 5
parent 8c1e754ab3
commit de222b8b1d
+22 -2
View File
@@ -2,6 +2,7 @@ package services
import (
"fmt"
"io"
"log"
"net/http"
"net/url"
@@ -45,8 +46,27 @@ func crawlearPagina(pageURL string) (*paginaCrawleada, error) {
return nil, fmt.Errorf("%s respondió %d", pageURL, resp.StatusCode)
}
ct := resp.Header.Get("Content-Type")
if ct != "" && !strings.Contains(ct, "text/html") {
return nil, fmt.Errorf("%s no es HTML (%s)", pageURL, ct)
esHTML := ct == "" || strings.Contains(ct, "text/html")
// Además de HTML, se acepta texto plano/Markdown servido tal cual — es un
// patrón cada vez más común (ej. este mismo caso: un .md pensado para que
// lo consuma una IA, sin ruido de HTML que limpiar).
esTexto := strings.Contains(ct, "text/plain") || strings.Contains(ct, "text/markdown") ||
strings.HasSuffix(strings.ToLower(strings.Split(pageURL, "?")[0]), ".md")
if !esHTML && !esTexto {
return nil, fmt.Errorf("%s no es HTML ni texto plano (%s)", pageURL, ct)
}
if !esHTML {
body, err := io.ReadAll(io.LimitReader(resp.Body, 2*1024*1024))
if err != nil {
return nil, fmt.Errorf("no se pudo leer %s: %w", pageURL, err)
}
pagina := &paginaCrawleada{URL: pageURL, Texto: normalizarEspacios(string(body))}
primeraLinea := strings.TrimSpace(strings.SplitN(string(body), "\n", 2)[0])
if strings.HasPrefix(primeraLinea, "#") {
pagina.Titulo = strings.TrimSpace(strings.TrimLeft(primeraLinea, "# "))
}
return pagina, nil
}
base, err := url.Parse(pageURL)