#!/bin/bash # Fuente F3 del plan: inventario historico de URLs segun Internet Archive. # No toca el origen ni produccion; es una consulta de solo lectura a web.archive.org. set -uo pipefail BASE=/home/rafa/joomla-migration/mirror-antiguo INV=$BASE/inventory mkdir -p "$INV" for host in antiguo.feadulta.com feadulta.com; do out="$INV/wayback-${host%%.*}.txt" echo "-> $host" curl -s --max-time 300 \ "https://web.archive.org/cdx/search/cdx?url=${host}*&output=text&fl=original&collapse=urlkey&limit=200000" \ > "$out" echo " $(wc -l < "$out") URLs" done wc -l "$INV"/wayback-*.txt