Mirror del Joomla antiguo: versionar los scripts y reponer los assets que faltaban
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore. Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner. Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido antes de copiar a site/. Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado. Refs #180 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,47 @@
|
||||
#!/usr/bin/env python3
|
||||
"""Cobertura real: cada URL del inventario debe tener su fichero en raw/.
|
||||
|
||||
Contempla las tres formas en que wget nombra el fichero:
|
||||
/es/x.html -> x.html
|
||||
/es/ -> index.html
|
||||
/es/x?.html (alias con '?' literal) -> "x?.html" o "x"
|
||||
"""
|
||||
import os, json
|
||||
from urllib.parse import urlsplit, unquote
|
||||
|
||||
BASE = "/home/rafa/joomla-migration/mirror-antiguo"
|
||||
RUN = open(os.path.join(BASE, "CURRENT_RUN")).read().strip()
|
||||
DIR = os.path.join(BASE, "runs", RUN)
|
||||
RAW = os.path.join(DIR, "raw", "antiguo.feadulta.com")
|
||||
|
||||
def candidates(url):
|
||||
rest = url.split("antiguo.feadulta.com", 1)[1]
|
||||
rest = unquote(rest)
|
||||
yield rest.lstrip("/") # nombre literal, con '?' incluido
|
||||
p = urlsplit(rest).path.lstrip("/")
|
||||
yield p # truncado en el '?'
|
||||
if rest.endswith("/") or p.endswith("/") or p == "":
|
||||
yield (p + "index.html")
|
||||
|
||||
ok, missing = 0, []
|
||||
urls = [l.strip() for l in open(os.path.join(BASE, "inventory", "urls-input.txt")) if l.strip()]
|
||||
for u in urls:
|
||||
if any(os.path.isfile(os.path.join(RAW, c)) for c in candidates(u) if c):
|
||||
ok += 1
|
||||
else:
|
||||
missing.append(u)
|
||||
|
||||
print("inventario:", len(urls))
|
||||
print("con fichero en raw/:", ok)
|
||||
print("sin fichero:", len(missing))
|
||||
print("cobertura: %.2f%%" % (ok * 100.0 / len(urls)))
|
||||
with open(os.path.join(DIR, "coverage-missing.txt"), "w") as f:
|
||||
for u in missing:
|
||||
f.write(u + "\n")
|
||||
for u in missing[:25]:
|
||||
print(" ", u)
|
||||
|
||||
total = sum(len(fs) for _r, _d, fs in os.walk(os.path.join(DIR, "raw")))
|
||||
json.dump({"inventario": len(urls), "capturadas": ok, "sin_fichero": len(missing),
|
||||
"cobertura_pct": round(ok * 100.0 / len(urls), 2), "ficheros_totales_raw": total},
|
||||
open(os.path.join(DIR, "coverage-report.json"), "w"), indent=2)
|
||||
Reference in New Issue
Block a user