Files
feadulta/mirror-antiguo/scripts/35-pase-c-huecos.sh
T
rafa 275aff1430 Mirror del Joomla antiguo: versionar los scripts y reponer los assets que faltaban
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que
generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore.

Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se
referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de
fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner.

Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio
que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido
antes de copiar a site/.

Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en
produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya
estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado.

Refs #180

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-31 14:04:31 -04:00

52 lines
2.0 KiB
Bash

#!/bin/bash
# Pase C: captura iterativa de las paginas internas enlazadas que no estaban en el inventario
# (rutas alternativas de menu, paginas de autor de K2, /anterior, ...).
# Itera hasta que no aparezcan URLs nuevas o hasta MAXIT vueltas.
set -uo pipefail
BASE=/home/rafa/joomla-migration/mirror-antiguo
RUN=$(cat "$BASE/CURRENT_RUN")
DIR=$BASE/runs/$RUN
MAXIT=${MAXIT:-6}
W=${WORKERS:-4}
REJECT='(\?|&)(start|limitstart|limit|print|tmpl|format|searchword|task|orderby|filter|catid|month|year)='
for it in $(seq 1 $MAXIT); do
IN=$DIR/passC-$it-input.txt
if [ "$it" = "1" ]; then
cp "$DIR/missing-real.txt" "$IN"
else
# recalcular huecos con lo capturado hasta ahora
python3 "$BASE/scripts/30-extract-links.py" > "$DIR/logs/extract-$it.log" 2>&1
grep -v '?' "$DIR/missing-pages.txt" > "$DIR/missing-pages-sinquery.txt"
python3 "$BASE/scripts/34-clasifica-missing.py" > "$DIR/logs/clasifica-$it.log" 2>&1
cp "$DIR/missing-real.txt" "$IN"
fi
n=$(wc -l < "$IN")
echo "=== iteracion $it: $n URLs candidatas ==="
[ "$n" -eq 0 ] && { echo "no quedan huecos"; break; }
mkdir -p "$DIR/chunks-c"
rm -f "$DIR/chunks-c"/*.txt
split -n l/$W -d --additional-suffix=.txt "$IN" "$DIR/chunks-c/c$it-"
for c in "$DIR/chunks-c"/c$it-*.txt; do
[ -s "$c" ] || continue
b=$(basename "$c" .txt)
wget --input-file="$c" \
--force-directories --directory-prefix="$DIR/raw" \
--adjust-extension --no-verbose --no-clobber -e robots=off \
--user-agent='feadulta-archiver/1.0 (+incident-183; mirror local)' \
--wait=0.1 --tries=2 --timeout=45 --waitretry=3 \
--reject-regex="$REJECT" \
--output-file="$DIR/logs/wget-$b.log" &
done
wait
echo " ficheros ahora: $(find "$DIR/raw" -type f | wc -l)"
echo " errores: $(grep -hoE 'ERROR [0-9]+' "$DIR/logs"/wget-c$it-*.log | sort | uniq -c | tr '\n' ' ')"
done
date -u +%FT%TZ > "$DIR/logs/passC.end"
echo "PASE C TERMINADO"
find "$DIR/raw" -type f | wc -l
du -sh "$DIR/raw"