275aff1430
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore. Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner. Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido antes de copiar a site/. Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado. Refs #180 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
20 lines
964 B
Bash
20 lines
964 B
Bash
#!/bin/bash
|
|
# ¿El ID de medicion del mirror es el MISMO que usa el WordPress vivo?
|
|
# Si lo es, publicar el mirror contaminaria la analitica con la que se decide el cutover.
|
|
set -uo pipefail
|
|
echo "=== ID en el mirror ==="
|
|
echo "G-6RT9ZRS4LW (GA4) + UA-32008163-1 (Universal Analytics, dejo de recoger datos en jul-2023)"
|
|
echo
|
|
echo "=== ids de Google en el WordPress local de feadulta ==="
|
|
for d in /home/rafa/joomla-migration/wordpress /home/rafa/Feadulta; do
|
|
[ -d "$d" ] || continue
|
|
echo "--- $d"
|
|
grep -rhoE 'G-[A-Z0-9]{8,}|UA-[0-9]+-[0-9]+|GTM-[A-Z0-9]+' "$d" 2>/dev/null | sort | uniq -c | sort -rn | head -5
|
|
done
|
|
echo
|
|
echo "=== ids de Google en el repo feadulta (mu-plugins/scripts) ==="
|
|
for d in /home/rafa/feadulta /home/rafa/joomla-migration; do
|
|
[ -d "$d" ] || continue
|
|
grep -rhoE 'G-[A-Z0-9]{8,}|UA-[0-9]+-[0-9]+|GTM-[A-Z0-9]+' "$d" --include='*.php' --include='*.py' --include='*.md' 2>/dev/null | sort | uniq -c | sort -rn | head -5
|
|
done
|