feat: migrate all managed LXC provisioning to OpenTofu (blue-green)

Blue-green: a new container is created beside the old one, data is copied, the
IP is moved onto it, and the old container is kept stopped as rollback for at
least a week. Keeping the IP means only the VMID changes, and its consumers
(backup jobs, backup audit) already derive it from the registry.

Batch 1 (2026-09-02): emergency-bot 148->151, docker-test 145->152,
gitea 141->153, vaultwarden 140->154, monitoring 146->155, gyro 150->156,
grimmory 149->157.
Batch 2 (2026-09-03): adguard 144->158, mihomo 143->159, ovpn-mini 132->160.
All migratable LXC are now provisioner: tofu. hermes-ai (frozen) and pbs stay.

- tofu/services.tf + tofu/svc-*.tf: one resource per service, reproducing the
  pct-config etalon. /dev/fuse -> features.fuse; /dev/net/tun ->
  device_passthrough (first live use on mihomo and ovpn-mini); gitea bind mount
  -> datastore volume (data finally reaches PBS); console { type = "shell" }
  declared explicitly (provider tracks cmode there).
- services.yml: vmid + provisioner: tofu for every migrated service; features
  strings and device notes updated to the tofu representation; also drops the
  memoir-bot entry and adds homelab_reverse_proxy_image/_unit.
- pve-*.yml: configuration play target is `{{ pve_config_target | default(...) }}`
  so it can run against <name>-new on a temp address (a bare --limit zeroes the
  play instead of retargeting it). Container-creation plays are gated behind
  `provisioner != 'tofu'` / `pve_provisioning_enabled` (meta: end_play), so a
  stray run cannot pct start a stopped OLD VMID on a live IP. Override for
  intentional legacy rollback: -e pve_<svc>_legacy_provisioning_enabled=true.
- ssh_config: drop memoir-bot; ovpn-mini gets ProxyJump none (a jump via ru-vps
  would route through the very tunnel ovpn-mini terminates).
- gyro.yml / uptime-kuma.yml: same pve_config_target override.
- roles/uptime_kuma: only freeze homelab-monitoring when the unit actually
  exists (a fresh blue-green container never had it).
- offsite-restic-yadisk.yml: the gitea restic profile now runs inside the LXC
  (hosts: gitea), since the bind-mount host path is gone after the volume move;
  lost+found excluded (unreadable in an unprivileged LXC, restic exit 3).

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_012uoq5AVK8mkBgg83Mq6o5V
This commit is contained in:
Dmitry
2026-09-03 07:05:46 +03:00
co-authored by Claude Sonnet 5
parent e349f19e68
commit a3fe8031fe
24 changed files with 1522 additions and 113 deletions
+10 -1
View File
@@ -1,6 +1,15 @@
---
- name: Configure Gyro investment allocator host
hosts: gyro
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit gyro-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/gyro.yml \
# -e pve_config_target=gyro-new --limit gyro-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('gyro') }}"
gather_facts: true
roles:
- role: gyro
+23 -10
View File
@@ -1,23 +1,36 @@
# Профиль выполняется ВНУТРИ контейнера gitea, а не на ноде cloud-pc.
# До переезда на OpenTofu (2026-09-02) данные жили в bind mount каталога ноды
# /opt/data/gitea, и профиль работал на самой ноде. После переезда данные —
# это volume контейнера (mp0 на datastore), снаружи LXC такого пути больше нет,
# поэтому профиль переехал внутрь по образцу vaultwarden. Репозиторий restic
# тот же, цепочка снапшотов продолжается; изменились только пути внутри них.
- name: Configure Gitea offsite backup to Yandex Disk
hosts: cloud-pc
hosts: gitea
gather_facts: false
vars:
ansible_become: false
offsite_profile: gitea
offsite_repository: rclone:yadisk:System/Backups/HomeLab/restic/gitea
offsite_source_path: /opt/data/gitea
offsite_sqlite_db: /opt/data/gitea/gitea/gitea.db
offsite_source_path: /opt/gitea/data
offsite_sqlite_db: /opt/gitea/data/gitea/gitea.db
offsite_backup_tag: gitea,cloud-pc,yadisk
offsite_timer_oncalendar: "*-*-* 04:15:00"
offsite_rclone_config_local: ~/.config/rclone/rclone.conf
offsite_restic_password_local: "{{ playbook_dir }}/../generated/restic-offsite-password"
offsite_excludes:
- /opt/data/gitea/gitea/gitea.db
- /opt/data/gitea/gitea/gitea.db-shm
- /opt/data/gitea/gitea/gitea.db-wal
- /opt/data/gitea/gitea/log/**
- /opt/data/gitea/gitea/sessions/**
- /opt/data/gitea/gitea/queues/**
- /opt/data/gitea/gitea/tmp/**
- /opt/gitea/data/gitea/gitea.db
- /opt/gitea/data/gitea/gitea.db-shm
- /opt/gitea/data/gitea/gitea.db-wal
- /opt/gitea/data/gitea/log/**
- /opt/gitea/data/gitea/sessions/**
- /opt/gitea/data/gitea/queues/**
- /opt/gitea/data/gitea/tmp/**
# lost+found появился вместе с переходом на volume: это свежая ext4, и
# каталог принадлежит uid 0 хоста, что внутри unprivileged LXC видно как
# nobody:nogroup и нечитаемо. Без исключения restic отдаёт exit 3
# ("at least one source file could not be read") и юнит падает каждую
# ночь, хотя снапшот при этом сохраняется. Найдено 2026-09-02.
- /opt/gitea/data/lost+found/**
tasks:
- name: Configure restic offsite profile
ansible.builtin.include_tasks: ../tasks/offsite-restic-profile.yml
+21 -1
View File
@@ -3,6 +3,13 @@
hosts: mini-pc
gather_facts: false
vars:
# После переезда на OpenTofu (tofu/svc-adguard.tf, VMID 158) этот play —
# legacy: он таргетит СТАРЫЙ VMID 144 и его handler сделал бы pct start 144,
# подняв остановленный откат на боевом адресе. Пропускаем, пока реестр
# говорит provisioner: tofu. Для намеренного legacy rollback:
# -e pve_adguard_legacy_provisioning_enabled=true
pve_adguard_legacy_provisioning_enabled: >-
{{ homelab_services['adguard'].provisioner != 'tofu' }}
adguard_vmid: 144
adguard_hostname: adguard
adguard_ip: 192.168.1.28/24
@@ -15,6 +22,10 @@
- name: restart adguard lxc
ansible.builtin.shell: "pct stop {{ adguard_vmid }} || true; pct start {{ adguard_vmid }}"
changed_when: true
pre_tasks:
- name: Skip legacy AdGuard provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_adguard_legacy_provisioning_enabled | bool)
tasks:
- name: Check if AdGuard LXC exists
ansible.builtin.command: "pct config {{ adguard_vmid }}"
@@ -93,7 +104,16 @@
ansible_become: false
- name: Configure AdGuard Home inside LXC
hosts: adguard
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit adguard-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-adguard.yml \
# -e pve_config_target=adguard-new --limit adguard-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('adguard') }}"
gather_facts: true
vars:
ansible_become: false
+10 -1
View File
@@ -79,7 +79,16 @@
ansible_become: false
- name: Configure Docker test host
hosts: docker-test
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit docker-test-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-docker-test.yml \
# -e pve_config_target=docker-test-new --limit docker-test-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('docker-test') }}"
gather_facts: true
vars:
ansible_become: false
+14 -1
View File
@@ -1,6 +1,10 @@
- name: Create Gitea LXC on cloud-pc
hosts: cloud-pc
gather_facts: false
pre_tasks:
- name: Skip legacy Gitea provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
vars:
gitea_vmid: 141
gitea_hostname: gitea
@@ -111,7 +115,16 @@
ansible_become: false
- name: Configure Docker and Gitea inside LXC
hosts: gitea
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit gitea-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-gitea.yml \
# -e pve_config_target=gitea-new --limit gitea-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('gitea') }}"
gather_facts: true
vars:
ansible_become: false
+37 -6
View File
@@ -2,6 +2,10 @@
- name: Guard Grimmory VMID before API updates
hosts: cloud-pc
gather_facts: false
pre_tasks:
- name: Skip legacy Grimmory provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
tasks:
- name: Read existing VMID 149 configuration
ansible.builtin.command: pct config 149
@@ -28,6 +32,10 @@
connection: local
become: false
gather_facts: false
pre_tasks:
- name: Skip legacy Grimmory provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
vars:
ansible_become: false
ansible_python_interpreter: "{{ ansible_playbook_python }}"
@@ -52,6 +60,10 @@
- name: Configure Grimmory LXC devices
hosts: cloud-pc
gather_facts: false
pre_tasks:
- name: Skip legacy Grimmory provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
vars:
grimmory_vmid: 149
handlers:
@@ -119,13 +131,32 @@
ansible_become: false
- name: Configure Grimmory runtime
hosts: grimmory
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit grimmory-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-grimmory.yml \
# -e pve_config_target=grimmory-new --limit grimmory-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('grimmory') }}"
gather_facts: true
vars:
ansible_become: false
grimmory_root: /opt/grimmory
grimmory_image: grimmory/grimmory:v3.2.4@sha256:dfa7afdfcf25d649fd664497a62385dd00cd9678c37546e182c172e41c8e80cb
grimmory_mariadb_image: lscr.io/linuxserver/mariadb:11.4.8@sha256:91de7f701bc7fc3a424b81beafca7a7c6c4c5b7c8be6afd2ae148698695c0b0c
# Адрес, на который биндится порт, на который смотрят правила DOCKER-USER и
# по которому проверяется health. Раньше во всех трёх местах был зашит
# боевой 192.168.1.34, из-за чего play нельзя было прогнать против другого
# контейнера: Docker не биндит чужой адрес и роняет grimmory.service, а
# health-check уходил по сети в БОЕВОЙ сервис и давал ложный успех.
# expected_lan_ip — уже принятая в репозитории идиома для "адрес этого
# хоста в LAN" (её же использует roles/uptime_kuma). На боевом grimmory она
# равна 192.168.1.34, поэтому рендер там не меняется. Найдено 2026-09-02
# при blue-green переезде на OpenTofu.
grimmory_bind_ip: "{{ expected_lan_ip }}"
tasks:
- name: Install Grimmory runtime packages
ansible.builtin.apt:
@@ -298,7 +329,7 @@
mariadb:
condition: service_healthy
ports:
- "192.168.1.34:6060:6060"
- "{{ grimmory_bind_ip }}:6060:6060"
volumes:
- ./data:/app/data
- ./books:/books
@@ -338,9 +369,9 @@
iptables -N GRIMMORY-FILTER 2>/dev/null || true
iptables -F GRIMMORY-FILTER
iptables -A GRIMMORY-FILTER -m conntrack --ctstate ESTABLISHED,RELATED -j ACCEPT
iptables -A GRIMMORY-FILTER -s {{ homelab_lan_cidr }} -p tcp -m conntrack --ctorigdst 192.168.1.34 --ctorigdstport 6060 -j ACCEPT
iptables -A GRIMMORY-FILTER -s {{ openvpn_network_cidr }} -p tcp -m conntrack --ctorigdst 192.168.1.34 --ctorigdstport 6060 -j ACCEPT
iptables -A GRIMMORY-FILTER -p tcp -m conntrack --ctorigdst 192.168.1.34 --ctorigdstport 6060 -j DROP
iptables -A GRIMMORY-FILTER -s {{ homelab_lan_cidr }} -p tcp -m conntrack --ctorigdst {{ grimmory_bind_ip }} --ctorigdstport 6060 -j ACCEPT
iptables -A GRIMMORY-FILTER -s {{ openvpn_network_cidr }} -p tcp -m conntrack --ctorigdst {{ grimmory_bind_ip }} --ctorigdstport 6060 -j ACCEPT
iptables -A GRIMMORY-FILTER -p tcp -m conntrack --ctorigdst {{ grimmory_bind_ip }} --ctorigdstport 6060 -j DROP
iptables -A GRIMMORY-FILTER -j RETURN
iptables -C DOCKER-USER -j GRIMMORY-FILTER 2>/dev/null || iptables -I DOCKER-USER 1 -j GRIMMORY-FILTER
register: grimmory_firewall_script
@@ -417,7 +448,7 @@
- name: Wait for Grimmory health endpoint
ansible.builtin.uri:
url: http://192.168.1.34:6060/api/v1/healthcheck
url: http://{{ grimmory_bind_ip }}:6060/api/v1/healthcheck
status_code: 200
register: grimmory_health
retries: 120
+16
View File
@@ -2,6 +2,12 @@
- name: Guard Gyro VMID before API updates
hosts: mini-pc
gather_facts: false
vars:
pve_gyro_legacy_provisioning_enabled: "{{ homelab_services['gyro'].provisioner != 'tofu' }}"
pre_tasks:
- name: Skip legacy Gyro provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_gyro_legacy_provisioning_enabled | bool)
tasks:
- name: Read existing VMID 150 configuration
ansible.builtin.command: pct config 150
@@ -29,6 +35,7 @@
become: false
gather_facts: false
vars:
pve_gyro_legacy_provisioning_enabled: "{{ homelab_services['gyro'].provisioner != 'tofu' }}"
ansible_become: false
ansible_python_interpreter: "{{ ansible_playbook_python }}"
pve_lxc_vmid: 150
@@ -45,6 +52,10 @@
pve_lxc_update: false
pve_lxc_features: []
pve_lxc_ostemplate: local:vztmpl/debian-13-standard_13.1-2_amd64.tar.zst
pre_tasks:
- name: Skip legacy Gyro provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_gyro_legacy_provisioning_enabled | bool)
roles:
- role: pve_lxc
@@ -52,7 +63,12 @@
hosts: mini-pc
gather_facts: false
vars:
pve_gyro_legacy_provisioning_enabled: "{{ homelab_services['gyro'].provisioner != 'tofu' }}"
gyro_vmid: 150
pre_tasks:
- name: Skip legacy Gyro provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_gyro_legacy_provisioning_enabled | bool)
tasks:
- name: Read Gyro LXC configuration
ansible.builtin.command: "pct config {{ gyro_vmid }}"
+21 -1
View File
@@ -3,6 +3,13 @@
hosts: mini-pc
gather_facts: false
vars:
# После переезда на OpenTofu (tofu/svc-mihomo.tf, VMID 159) этот play —
# legacy: он таргетит СТАРЫЙ VMID 143 и его handler сделал бы pct start 143,
# подняв остановленный откат на боевом адресе. Пропускаем, пока реестр
# говорит provisioner: tofu. Для намеренного legacy rollback:
# -e pve_mihomo_legacy_provisioning_enabled=true
pve_mihomo_legacy_provisioning_enabled: >-
{{ homelab_services['mihomo'].provisioner != 'tofu' }}
mihomo_vmid: 143
mihomo_hostname: mihomo
mihomo_ip: 192.168.1.27/24
@@ -15,6 +22,10 @@
- name: restart mihomo lxc
ansible.builtin.shell: "pct stop {{ mihomo_vmid }} || true; pct start {{ mihomo_vmid }}"
changed_when: true
pre_tasks:
- name: Skip legacy mihomo provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_mihomo_legacy_provisioning_enabled | bool)
tasks:
- name: Check if mihomo LXC exists
ansible.builtin.command: "pct config {{ mihomo_vmid }}"
@@ -107,7 +118,16 @@
ansible_become: false
- name: Prepare mihomo runtime host
hosts: mihomo
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit mihomo-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-mihomo.yml \
# -e pve_config_target=mihomo-new --limit mihomo-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('mihomo') }}"
gather_facts: true
vars:
ansible_become: false
+23
View File
@@ -1,7 +1,23 @@
---
# После переезда на OpenTofu (tofu/svc-ovpn-mini.tf, VMID 160) обе play здесь —
# legacy: они таргетят СТАРЫЙ VMID 132, а их handlers сделали бы pct start 132,
# подняв остановленный откат на боевом адресе 192.168.1.23. Пропускаем, пока
# реестр говорит provisioner: tofu. Конфигурация OpenVPN-шлюза в этот плейбук
# никогда не входила — она в playbooks/openvpn-vps-mini.yml (роль
# openvpn_gateway, группа vpn_openvpn). Для намеренного legacy rollback:
# -e pve_ovpn_mini_legacy_provisioning_enabled=true
- name: Create ovpn-mini LXC on mini-pc
hosts: localhost
connection: local
gather_facts: false
vars:
pve_ovpn_mini_legacy_provisioning_enabled: >-
{{ homelab_services['ovpn-mini'].provisioner != 'tofu' }}
pre_tasks:
- name: Skip legacy ovpn-mini provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_ovpn_mini_legacy_provisioning_enabled | bool)
roles:
- role: pve_lxc
vars:
@@ -18,10 +34,17 @@
hosts: mini-pc
gather_facts: false
become: true
vars:
pve_ovpn_mini_legacy_provisioning_enabled: >-
{{ homelab_services['ovpn-mini'].provisioner != 'tofu' }}
handlers:
- name: restart ovpn-mini lxc
ansible.builtin.shell: pct stop 132 || true; pct start 132
changed_when: true
pre_tasks:
- name: Skip legacy ovpn-mini provisioning after cutover
ansible.builtin.meta: end_play
when: not (pve_ovpn_mini_legacy_provisioning_enabled | bool)
tasks:
- name: Allow /dev/net/tun device
ansible.builtin.lineinfile:
+18 -1
View File
@@ -2,6 +2,10 @@
- name: Guard Vaultwarden VMID before API updates
hosts: mini-pc
gather_facts: false
pre_tasks:
- name: Skip legacy Vaultwarden provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
tasks:
- name: Read existing VMID 140 configuration
ansible.builtin.command: pct config 140
@@ -25,6 +29,10 @@
- name: Create Vaultwarden LXC on mini-pc
hosts: mini-pc
gather_facts: false
pre_tasks:
- name: Skip legacy Vaultwarden provisioning for runtime-only calls
ansible.builtin.meta: end_play
when: not (pve_provisioning_enabled | default(true) | bool)
vars:
vaultwarden_vmid: 140
vaultwarden_hostname: vaultwarden
@@ -103,7 +111,16 @@
ansible_become: false
- name: Configure Docker and Vaultwarden inside LXC
hosts: vaultwarden
# Таргет переопределяем ради blue-green переезда на OpenTofu: во время
# миграции этот play нужно прогнать против нового контейнера на временном
# адресе. Просто `--limit vaultwarden-new` для этого НЕ годится — лимит
# пересекается с паттерном play и даёт ноль хостов, а не перенацеливание
# (проверено 2026-09-02 через --list-hosts на всех плейбуках).
# Использовать вместе с --limit, чтобы play создания контейнера отсеялся:
# ansible-playbook playbooks/pve-vaultwarden.yml \
# -e pve_config_target=vaultwarden-new --limit vaultwarden-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('vaultwarden') }}"
gather_facts: true
vars:
ansible_become: false
+8 -1
View File
@@ -1,6 +1,13 @@
---
- name: Freeze Prometheus monitoring and configure Uptime Kuma
hosts: monitoring_server
# Таргет переопределяем ради blue-green переезда на OpenTofu: конфигурацию
# нужно прогнать против нового контейнера на временном адресе. `--limit`
# сам по себе не перенацеливает play, а обнуляет его (проверено 2026-09-02).
# Использовать вместе с --limit:
# ansible-playbook playbooks/uptime-kuma.yml \
# -e pve_config_target=monitoring-new --limit monitoring-new
# По умолчанию поведение не меняется.
hosts: "{{ pve_config_target | default('monitoring_server') }}"
gather_facts: false
roles:
- role: uptime_kuma