Files
feadulta/mirror-antiguo/scripts/87-quita-social.py
T
rafa 275aff1430 Mirror del Joomla antiguo: versionar los scripts y reponer los assets que faltaban
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que
generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore.

Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se
referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de
fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner.

Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio
que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido
antes de copiar a site/.

Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en
produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya
estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado.

Refs #180

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-31 14:04:31 -04:00

109 lines
4.2 KiB
Python

#!/usr/bin/env python3
"""Quita los botones sociales del derivado `site/`. `raw/` no se toca.
El bloque de K2 es uniforme en las 16.708 paginas que lo llevan: `<div class="itemSocialSharing">`
contiene el boton de Twitter, el de Facebook y un clearfix, nada mas (comprobado con
86-survey-social.py sobre 400 paginas: 0 variantes). Se elimina el bloque entero, asi no quedan
huecos ni botones rotos.
Red de seguridad: fuera del bloque tambien se eliminan los <script> a esos dos hosts y cualquier
`<div id="fb-root">` suelto.
"""
import os, re, json
from collections import Counter
BASE = "/home/rafa/joomla-migration/mirror-antiguo"
RUN = open(os.path.join(BASE, "CURRENT_RUN")).read().strip()
DIR = os.path.join(BASE, "runs", RUN)
SITE = os.path.join(DIR, "site", "antiguo.feadulta.com")
OPEN = re.compile(r'<div\b[^>]*class="[^"]*itemSocialSharing[^"]*"[^>]*>', re.I)
DIV = re.compile(r'<div\b[^>]*>|</div>', re.I)
SOCIAL_SCRIPT = re.compile(
r'<script[^>]+src="[^"]*(?:platform\.twitter\.com|connect\.facebook\.net)[^"]*"[^>]*>\s*</script>',
re.I)
FB_ROOT = re.compile(r'<div\s+id="fb-root"\s*>\s*</div>', re.I)
TW_ANCHOR = re.compile(r'<a\b[^>]*class="[^"]*twitter-share-button[^"]*"[^>]*>.*?</a>', re.I | re.S)
FB_LIKE = re.compile(r'<div\b[^>]*class="[^"]*fb-like[^"]*"[^>]*>\s*</div>', re.I)
AVISO = ('<!-- botones sociales retirados del archivo historico '
'(no procede compartir ni cargar SDK de terceros) -->')
def es_html(path, fn):
"""Decidir por extension no basta en este mirror: conviven `x.html?tmpl=…` (la extension esta
antes de la query) y `x?.html` con su copia `x` sin extension (alias de K2 con '?' literal).
Para esos casos se mira el contenido, que es lo unico fiable."""
base = fn.split("?", 1)[0].lower()
if base.endswith((".html", ".htm")) or fn.lower().endswith((".html", ".htm")):
return True
if "." in fn.split("/")[-1].split("?", 1)[0]:
return False # tiene otra extension (jpg, mp3, css…)
try:
with open(path, "rb") as f:
cabeza = f.read(512).lstrip().lower()
return cabeza.startswith(b"<!doctype html") or cabeza.startswith(b"<html")
except OSError:
return False
def quita_bloques(html, st):
out, pos = [], 0
while True:
m = OPEN.search(html, pos)
if not m:
out.append(html[pos:])
return "".join(out)
depth, fin = 0, None
for d in DIV.finditer(html, m.start()):
if d.group(0).lower().startswith("</"):
depth -= 1
if depth == 0:
fin = d.end()
break
else:
depth += 1
if fin is None: # bloque sin cerrar: no lo tocamos
st["bloques_sin_cerrar"] += 1
out.append(html[pos:m.end()])
pos = m.end()
continue
out.append(html[pos:m.start()])
out.append(AVISO)
st["bloques_retirados"] += 1
pos = fin
def main():
st = Counter()
for root, _d, files in os.walk(SITE):
for fn in files:
p = os.path.join(root, fn)
if not es_html(p, fn):
continue
try:
html = open(p, encoding="utf-8", errors="replace").read()
except OSError:
continue
if not any(k in html for k in
("itemSocialSharing", "platform.twitter.com", "connect.facebook.net", "fb-root")):
continue
orig = html
html = quita_bloques(html, st)
html, n = SOCIAL_SCRIPT.subn("", html); st["scripts_sueltos"] += n
html, n = TW_ANCHOR.subn("", html); st["botones_twitter_sueltos"] += n
html, n = FB_LIKE.subn("", html); st["botones_fb_sueltos"] += n
html, n = FB_ROOT.subn("", html); st["fb_root_sueltos"] += n
if html != orig:
open(p, "w", encoding="utf-8").write(html)
st["ficheros_modificados"] += 1
out = os.path.join(DIR, "social-removal.json")
json.dump(dict(st), open(out, "w"), indent=2, ensure_ascii=False)
print(json.dumps(dict(st), indent=2, ensure_ascii=False))
print("informe:", out)
if __name__ == "__main__":
main()