From b4bc759eda4165b151c6c5faa30913721b832bdc Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Nicol=C3=B2=20Rossi?= Date: Thu, 16 Jul 2026 12:49:40 +0200 Subject: [PATCH] improved rollback management --- .gitea/workflows/deploy-env-dns.yml | 207 +++++++++++++++++++++------- 1 file changed, 157 insertions(+), 50 deletions(-) diff --git a/.gitea/workflows/deploy-env-dns.yml b/.gitea/workflows/deploy-env-dns.yml index fceac85..f213fd5 100644 --- a/.gitea/workflows/deploy-env-dns.yml +++ b/.gitea/workflows/deploy-env-dns.yml @@ -113,7 +113,15 @@ jobs: ssh ${DEPLOY_USER}@${HOST} " set -e cd ${REMOTE_PATH} - rm -rf .rollback && mkdir -p .rollback + # Se esiste già uno .rollback, non cancellarlo: potrebbe essere l'unica + # traccia di un deploy precedente il cui rollback non è andato a buon + # fine. Lo archiviamo invece di distruggerlo. + if [ -d .rollback ]; then + rm -rf .rollback.bak + mv .rollback .rollback.bak + echo 'Trovato uno .rollback preesistente: archiviato in .rollback.bak.' + fi + mkdir -p .rollback if [ -f ${COMPOSE} ]; then cp -f ${COMPOSE} .rollback/${COMPOSE} [ -f ${ENV_FILE} ] && cp -f ${ENV_FILE} .rollback/${ENV_FILE} || true @@ -140,6 +148,59 @@ jobs: [ -f "$APACHE" ] && FILES_TO_COPY="${FILES_TO_COPY} ${APACHE}" scp ${FILES_TO_COPY} ${DEPLOY_USER}@${HOST}:${REMOTE_PATH}/ + # Script di sync FE -> /etc/hosts, usato sia dopo un deploy riuscito + # sia dal rollback: la stessa logica in un unico posto evita che le + # due strade si disallineino (es. il fix di un bug fatto solo in uno + # dei due punti). Aggiorna sempre l'IP se cambiato, non solo se assente: + # il container FE viene ricreato ad ogni deploy (o rollback) e riceve + # quasi certamente un IP diverso sulla bridge network di Docker. + cat > /tmp/sync-fe-hosts.sh << 'EOF' + #!/bin/sh + set -e + COMPOSE="$1" + ENV_FILE="$2" + + ENVFLAG="" + [ -n "$ENV_FILE" ] && [ -f "$ENV_FILE" ] && ENVFLAG="--env-file $ENV_FILE" + + FE_CID="" + for cid in $(docker compose -f "$COMPOSE" $ENVFLAG ps -q); do + t=$(docker inspect -f '{{ index .Config.Labels "type" }}' "$cid" 2>/dev/null || true) + if [ "$t" = "FE" ]; then + FE_CID="$cid" + break + fi + done + + if [ -z "$FE_CID" ]; then + echo "Nessun container con label type=FE trovato: /etc/hosts non modificato." + exit 0 + fi + + SVC_NAME=$(docker inspect -f '{{ index .Config.Labels "com.docker.compose.service" }}' "$FE_CID") + FE_IP=$(docker inspect -f '{{range .NetworkSettings.Networks}}{{.IPAddress}}{{end}}' "$FE_CID") + + if [ -z "$SVC_NAME" ] || [ -z "$FE_IP" ]; then + echo "ATTENZIONE: impossibile determinare nome servizio o IP del container FE." + exit 0 + fi + + echo "Container FE trovato: servizio=$SVC_NAME ip=$FE_IP" + + CURRENT_IP=$(awk -v s="$SVC_NAME" '$2==s{print $1; exit}' /etc/hosts) + if [ "$CURRENT_IP" = "$FE_IP" ]; then + echo "Voce gia' aggiornata in /etc/hosts per '$SVC_NAME' ($FE_IP), nessuna modifica." + else + if [ -n "$CURRENT_IP" ]; then + echo "IP cambiato per '$SVC_NAME': $CURRENT_IP -> $FE_IP. Aggiorno /etc/hosts." + sed -i "/[[:space:]]$SVC_NAME\$/d" /etc/hosts + fi + echo "$FE_IP $SVC_NAME" >> /etc/hosts + echo "Voce in /etc/hosts aggiornata: $FE_IP $SVC_NAME" + fi + EOF + scp /tmp/sync-fe-hosts.sh ${DEPLOY_USER}@${HOST}:${REMOTE_PATH}/.sync-fe-hosts.sh + # ───────────────────────────────────────────────────────────── # APACHE: sostituiamo il file di config SOLO se è cambiato. # Il backup timestamped viene creato solo in caso di differenza. @@ -208,10 +269,13 @@ jobs: # Deploy OK: attiva il sito e ricarica Apache con la nuova config ssh ${DEPLOY_USER}@${HOST} "a2ensite ${SITE} -q" ssh ${DEPLOY_USER}@${HOST} "service apache2 reload" - ssh ${DEPLOY_USER}@${HOST} "DOCKER_CONFIG=/tmp/.docker-ci docker image prune -a -f" - # Deploy riuscito: lo snapshot di rollback non serve più - ssh ${DEPLOY_USER}@${HOST} "rm -rf ${REMOTE_PATH}/.rollback ${REMOTE_PATH}/.apache-rollback" + # NB: lo snapshot di rollback (.rollback, .apache-rollback) e le immagini + # precedenti NON vengono ripulite qui. Il comando post-deploy-cmd qui sotto + # può ancora fallire (es. uno smoke test/health-check): se il rollback + # dovesse servire, deve trovare ancora tutti i dati intatti. La pulizia + # avviene solo nello step dedicato "Cleanup rollback", eseguito per ultimo + # e solo se l'intero job è andato a buon fine. # Comando custom (solo se fornito) if [ -n "${{ inputs.post-deploy-cmd }}" ]; then @@ -231,14 +295,43 @@ jobs: echo "── Container status ──" ssh ${DEPLOY_USER}@${HOST} "${CBASE} ps" - # Cleanup config temporaneo - ssh ${DEPLOY_USER}@${HOST} "rm -rf /tmp/.docker-ci" + # Verifica reale (non solo informativa): se un servizio non è "running" + # o risulta "unhealthy", lo step fallisce e innesca il rollback. + ssh ${DEPLOY_USER}@${HOST} " + set -e + ids=\$(${CBASE} ps -q) + if [ -z \"\$ids\" ]; then + echo 'ERRORE: nessun container in esecuzione dopo il deploy.' + exit 1 + fi + fail=0 + for cid in \$ids; do + svc=\$(docker inspect -f '{{ index .Config.Labels \"com.docker.compose.service\" }}' \$cid 2>/dev/null) + [ -z \"\$svc\" ] && svc=\$cid + status=\$(docker inspect -f '{{.State.Status}}' \$cid) + health=\$(docker inspect -f '{{if .State.Health}}{{.State.Health.Status}}{{else}}n/a{{end}}' \$cid) + echo \"Servizio \$svc: status=\$status health=\$health\" + if [ \"\$status\" != 'running' ]; then + echo \"ERRORE: servizio \$svc non e' in stato running.\" + fail=1 + fi + if [ \"\$health\" = 'unhealthy' ]; then + echo \"ERRORE: servizio \$svc risulta unhealthy.\" + fail=1 + fi + done + exit \$fail + " # ───────────────────────────────────────────────────────────── # HOSTS: dopo un deploy riuscito, recuperiamo l'IP del container # FE (label type=FE) e ci assicuriamo che /etc/hosts sul server - # abbia una voce "IP nome_servizio". Non tocca righe esistenti - # con lo stesso nome: aggiunge solo se assente. + # abbia una voce "IP nome_servizio" aggiornata. A differenza della + # versione precedente, se il container viene ricreato con un IP + # diverso la voce ESISTENTE viene aggiornata (non solo aggiunta se + # assente) — logica delegata a .sync-fe-hosts.sh, che viene + # richiamato anche dallo step di Rollback per rimanere coerente + # con qualunque versione (nuova o ripristinata) finisca in esecuzione. # ───────────────────────────────────────────────────────────── - name: Aggiorna /etc/hosts con IP container FE run: | @@ -247,48 +340,41 @@ jobs: COMPOSE="docker-compose-${ENV_NAME}.yml" ENV_FILE=".env_${ENV_NAME}" - ENVFLAG="" - [ -f "$ENV_FILE" ] && ENVFLAG="--env-file ${ENV_FILE}" + ssh ${DEPLOY_USER}@${HOST} "cd ${REMOTE_PATH} && sh .sync-fe-hosts.sh ${COMPOSE} ${ENV_FILE}" + + # ───────────────────────────────────────────────────────────── + # CLEANUP: eseguito SOLO se tutti gli step precedenti sono andati + # a buon fine (compreso post-deploy-cmd e la verifica container). + # Solo a questo punto è sicuro eliminare gli snapshot di rollback: + # se questa pulizia venisse fatta prima (come accadeva nel vecchio + # step "Post-deploy"), un fallimento successivo lascerebbe il + # rollback senza dati con cui operare. + # Rimuove solo l'immagine precedente pinnata (non un prune globale): + # su un host condiviso da più progetti un "docker image prune -a -f" + # cancellerebbe anche snapshot di rollback di ALTRI progetti. + # ───────────────────────────────────────────────────────────── + - name: Cleanup rollback (deploy riuscito) + if: success() + run: | + HOST="${{ vars[inputs.host-var] }}" + REMOTE_PATH="${DEPLOY_BASE_PATH}/${{ github.repository_owner }}/${{ github.event.repository.name }}" ssh ${DEPLOY_USER}@${HOST} " cd ${REMOTE_PATH} - - FE_CID='' - for cid in \$(docker compose -f ${COMPOSE} ${ENVFLAG} ps -q); do - t=\$(docker inspect -f '{{ index .Config.Labels \"type\" }}' \$cid 2>/dev/null || true) - if [ \"\$t\" = 'FE' ]; then - FE_CID=\$cid - break - fi - done - - if [ -z \"\$FE_CID\" ]; then - echo 'Nessun container con label type=FE trovato: /etc/hosts non modificato.' - exit 0 - fi - - SVC_NAME=\$(docker inspect -f '{{ index .Config.Labels \"com.docker.compose.service\" }}' \$FE_CID) - FE_IP=\$(docker inspect -f '{{range .NetworkSettings.Networks}}{{.IPAddress}}{{end}}' \$FE_CID) - - if [ -z \"\$SVC_NAME\" ] || [ -z \"\$FE_IP\" ]; then - echo 'ATTENZIONE: impossibile determinare nome servizio o IP del container FE.' - exit 0 - fi - - echo \"Container FE trovato: servizio=\$SVC_NAME ip=\$FE_IP\" - - if grep -qw \"\$SVC_NAME\" /etc/hosts; then - echo \"Voce già presente in /etc/hosts per '\$SVC_NAME', nessuna modifica.\" - else - echo \"\$FE_IP \$SVC_NAME\" >> /etc/hosts - echo \"Aggiunta voce in /etc/hosts: \$FE_IP \$SVC_NAME\" + if [ -f .rollback/pin.yml ]; then + for img in \$(grep 'image:' .rollback/pin.yml | awk '{print \$2}' | tr -d '\"'); do + docker rmi \"\$img\" >/dev/null 2>&1 || true + done fi + rm -rf .rollback .rollback.bak .apache-rollback " + ssh ${DEPLOY_USER}@${HOST} "rm -rf /tmp/.docker-ci" || true # ───────────────────────────────────────────────────────────── # ROLLBACK: eseguito SOLO se uno step precedente è fallito. # 1) ripristina la config Apache precedente e riabilita il sito # 2) riporta i container alla versione precedente (immagini pinnate) + # 3) risincronizza /etc/hosts con l'IP del container FE ripristinato # ───────────────────────────────────────────────────────────── - name: Rollback (deploy fallito) if: failure() @@ -304,8 +390,10 @@ jobs: echo "Deploy fallito: avvio rollback." - # 1) Ripristino config Apache + # 1) Ripristino config Apache (con apache2ctl configtest come gate prima del reload) + apache_ok=0 ssh ${DEPLOY_USER}@${HOST} " + set -e ACTIVE=/etc/apache2/sites-available/${SITE}.conf MARK=${REMOTE_PATH}/.apache-rollback if [ -f \"\$MARK\" ]; then @@ -313,7 +401,7 @@ jobs: if [ -n \"\$BK\" ] && [ -f \"\$BK\" ]; then echo \"Ripristino config Apache da \$BK\" cp -v \"\$BK\" \"\$ACTIVE\" - a2ensite ${SITE} -q || true + a2ensite ${SITE} -q else echo 'Nessuna config precedente: rimuovo e disabilito il sito.' rm -f \"\$ACTIVE\" @@ -322,12 +410,14 @@ jobs: rm -f \"\$MARK\" else echo 'Config Apache non modificata: riabilito il sito corrente.' - a2ensite ${SITE} -q || true + a2ensite ${SITE} -q fi - service apache2 reload || true - " + apache2ctl configtest + service apache2 reload + " || apache_ok=1 # 2) Rollback dei container alla versione precedente + container_ok=0 ssh ${DEPLOY_USER}@${HOST} " set -e cd ${REMOTE_PATH} @@ -337,12 +427,29 @@ jobs: PIN='' [ -f .rollback/pin.yml ] && PIN='-f .rollback/pin.yml' echo 'Ripristino container alla versione precedente...' - DOCKER_CONFIG=/tmp/.docker-ci docker compose -f ${COMPOSE} \$PIN ${ENVFLAG} up -d \ - || echo 'ATTENZIONE: rollback container non riuscito, verifica manuale necessaria.' + DOCKER_CONFIG=/tmp/.docker-ci docker compose -f ${COMPOSE} \$PIN ${ENVFLAG} up -d else echo 'Nessuno snapshot disponibile: nessun rollback container (probabile primo deploy).' fi - " + " || container_ok=1 - # Cleanup config temporaneo - ssh ${DEPLOY_USER}@${HOST} "rm -rf /tmp/.docker-ci" || true \ No newline at end of file + # 3) Risincronizza /etc/hosts con l'IP del container FE dopo il rollback. + # Non si ripristina un vecchio valore salvato: il container viene + # ricreato da "docker compose up -d" e riceve quasi certamente un IP + # diverso (anche restando sulla stessa immagine precedente), quindi + # si usa lo stesso script di sync usato dopo un deploy riuscito. + # Prima di questa fix, un rollback lasciava /etc/hosts con l'IP del + # deploy fallito (o, se prima non c'era una voce, nessuna voce), + # puntando a un container che non esiste più. + hosts_ok=0 + ssh ${DEPLOY_USER}@${HOST} "cd ${REMOTE_PATH} && sh .sync-fe-hosts.sh ${COMPOSE} ${ENV_FILE}" || hosts_ok=1 + + # Cleanup config temporaneo (best-effort, non deve mascherare l'esito del rollback) + ssh ${DEPLOY_USER}@${HOST} "rm -rf /tmp/.docker-ci" || true + + if [ "$apache_ok" -ne 0 ] || [ "$container_ok" -ne 0 ] || [ "$hosts_ok" -ne 0 ]; then + echo "ERRORE: rollback automatico NON riuscito (apache_ok=$apache_ok, container_ok=$container_ok, hosts_ok=$hosts_ok). E' necessario un intervento manuale immediato." + exit 1 + fi + + echo "Rollback completato con successo: sistema ripristinato alla versione precedente." \ No newline at end of file