Mirror del Joomla antiguo: versionar los scripts y reponer los assets que faltaban
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore. Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner. Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido antes de copiar a site/. Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado. Refs #180 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,64 @@
|
||||
#!/usr/bin/env python3
|
||||
"""Antes de tocar nada: que hay realmente dentro de los bloques sociales del mirror."""
|
||||
import os, re
|
||||
from collections import Counter
|
||||
|
||||
BASE = "/home/rafa/joomla-migration/mirror-antiguo"
|
||||
RUN = open(os.path.join(BASE, "CURRENT_RUN")).read().strip()
|
||||
SITE = os.path.join(BASE, "runs", RUN, "site", "antiguo.feadulta.com")
|
||||
|
||||
OPEN = re.compile(r'<div\b[^>]*class="[^"]*itemSocialSharing[^"]*"[^>]*>', re.I)
|
||||
DIV = re.compile(r'<div\b[^>]*>|</div>', re.I)
|
||||
CLASS = re.compile(r'<div\b[^>]*class="([^"]+)"', re.I)
|
||||
SCRIPTSRC = re.compile(r'<script[^>]+src="([^"]+)"', re.I)
|
||||
|
||||
def bloque(html, m):
|
||||
"""Devuelve (inicio, fin) del div equilibrado que empieza en m."""
|
||||
depth, pos = 0, m.start()
|
||||
for d in DIV.finditer(html, m.start()):
|
||||
if d.group(0).lower().startswith("</"):
|
||||
depth -= 1
|
||||
if depth == 0:
|
||||
return m.start(), d.end()
|
||||
else:
|
||||
depth += 1
|
||||
return None
|
||||
|
||||
clases, scripts, sin_bloque, con_bloque = Counter(), Counter(), 0, 0
|
||||
n = 0
|
||||
for root, _d, files in os.walk(SITE):
|
||||
for fn in files:
|
||||
if not fn.split("?", 1)[0].lower().endswith((".html", ".htm")):
|
||||
continue
|
||||
p = os.path.join(root, fn)
|
||||
try:
|
||||
html = open(p, encoding="utf-8", errors="replace").read()
|
||||
except OSError:
|
||||
continue
|
||||
if "itemSocialSharing" not in html:
|
||||
continue
|
||||
n += 1
|
||||
if n > 400:
|
||||
break
|
||||
for m in OPEN.finditer(html):
|
||||
r = bloque(html, m)
|
||||
if not r:
|
||||
sin_bloque += 1
|
||||
continue
|
||||
con_bloque += 1
|
||||
frag = html[r[0]:r[1]]
|
||||
for c in CLASS.findall(frag):
|
||||
clases[c.strip()] += 1
|
||||
for s in SCRIPTSRC.findall(frag):
|
||||
scripts[s.split("?")[0]] += 1
|
||||
if n > 400:
|
||||
break
|
||||
|
||||
print("paginas inspeccionadas con itemSocialSharing:", n)
|
||||
print("bloques equilibrados:", con_bloque, " sin cerrar:", sin_bloque)
|
||||
print("\n--- clases de div dentro del bloque ---")
|
||||
for k, v in clases.most_common(15):
|
||||
print("%7d %s" % (v, k))
|
||||
print("\n--- scripts dentro del bloque ---")
|
||||
for k, v in scripts.most_common(15):
|
||||
print("%7d %s" % (v, k))
|
||||
Reference in New Issue
Block a user