275aff1430
Los scripts del mirror (00-90) vivian solo en el disco. Van al repo; los datos que generan no (16 GB entre crawl, snapshot del origen y Joomla restaurado) -> .gitignore. Nuevo 91-repone-assets404.sh: repone los ficheros que el crawl no capturo porque se referencian SOLO desde CSS y el crawler seguia enlaces HTML (system.css, los fondos de fe_adulta_1, ratingstars.gif de K2). Salian como 404 en los logs de nginx del Hetzner. Descarga por HTTP desde el Joomla local aislado, nunca del filesystem -- mismo principio que el crawl, para no arrastrar los .php comprometidos del #183 -- y escanea PHP embebido antes de copiar a site/. Resultado sobre las 286 rutas unicas con 404 del log: 196 repuestas y verificadas en produccion (196/196 en 200 tras el rsync), 82 que dan 301->404 tambien en el origen (ya estaban rotas en la web original) y 8 rutas basura /%22/... de HTML mal formado. Refs #180 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
18 lines
600 B
Bash
18 lines
600 B
Bash
#!/bin/bash
|
|
# Fuente F3 del plan: inventario historico de URLs segun Internet Archive.
|
|
# No toca el origen ni produccion; es una consulta de solo lectura a web.archive.org.
|
|
set -uo pipefail
|
|
BASE=/home/rafa/joomla-migration/mirror-antiguo
|
|
INV=$BASE/inventory
|
|
mkdir -p "$INV"
|
|
|
|
for host in antiguo.feadulta.com feadulta.com; do
|
|
out="$INV/wayback-${host%%.*}.txt"
|
|
echo "-> $host"
|
|
curl -s --max-time 300 \
|
|
"https://web.archive.org/cdx/search/cdx?url=${host}*&output=text&fl=original&collapse=urlkey&limit=200000" \
|
|
> "$out"
|
|
echo " $(wc -l < "$out") URLs"
|
|
done
|
|
wc -l "$INV"/wayback-*.txt
|