Files
feadulta/mirror-antiguo/scripts/53-pase-d2-anterior-inventario.sh
rafa 275aff1430 Mirror del Joomla antiguo: versionar los scripts y reponer los assets que faltaban
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que
generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore.

Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se
referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de
fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner.

Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio
que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido
antes de copiar a site/.

Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en
produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya
estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado.

Refs #180

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-31 14:04:31 -04:00

46 lines
1.9 KiB
Bash

#!/bin/bash
# Pase D (corregido): /anterior por INVENTARIO, no por recursion.
#
# La recursion sobre /anterior funcionaba, pero se estaba comiendo el tiempo en 404: la web antigua
# esta llena de enlaces rotos (imagenes de los `_archivos/` de exportaciones de Word que ya no
# existen). Iban 3.050 aciertos por 2.744 fallos. Misma leccion del post-mortem: acotar por
# inventario. Aqui el inventario es el listado de ficheros del snapshot restaurado — solo la LISTA
# DE RUTAS, igual que se hace con la BD; el contenido se sigue capturando por HTTP.
set -uo pipefail
BASE=/home/rafa/joomla-migration/mirror-antiguo
RUN=$(cat "$BASE/CURRENT_RUN")
D=$BASE/runs/$RUN
SRC=$BASE/restore/web/anterior
W=${WORKERS:-4}
pkill -f 'antiguo.feadulta.com/anterior/$' && echo "recursion detenida" || echo "recursion ya parada"
sleep 2
cd "$BASE/restore/web"
find anterior -type f ! -iname '*.php' -printf '%p\n' \
| sed 's#^#http://antiguo.feadulta.com/#' \
| sort -u > "$D/anterior-input.txt"
echo "inventario de /anterior: $(wc -l < "$D/anterior-input.txt") ficheros (excluidos los .php)"
echo "php excluidos: $(find anterior -type f -iname '*.php' | wc -l)"
mkdir -p "$D/chunks-d"; rm -f "$D/chunks-d"/*.txt
split -n l/$W -d --additional-suffix=.txt "$D/anterior-input.txt" "$D/chunks-d/d-"
date -u +%FT%TZ > "$D/logs/passD2.start"
for c in "$D/chunks-d"/d-*.txt; do
b=$(basename "$c" .txt)
wget --input-file="$c" \
--force-directories --directory-prefix="$D/raw" \
--no-verbose --no-clobber -e robots=off \
--user-agent='feadulta-archiver/1.0 (+incident-183; mirror local)' \
--wait=0.02 --tries=2 --timeout=45 --waitretry=3 \
--output-file="$D/logs/wget-$b.log" &
done
wait
date -u +%FT%TZ > "$D/logs/passD2.end"
echo "PASE D TERMINADO"
echo "ficheros bajo /anterior: $(find "$D/raw/antiguo.feadulta.com/anterior" -type f | wc -l)"
du -sh "$D/raw/antiguo.feadulta.com/anterior"
grep -hoE 'ERROR [0-9]+' "$D/logs"/wget-d-*.log | sort | uniq -c