Один коміт, а не десяток тематичних, свідомо: теми переплетені в
спільних файлах (store.go, docker-compose.yml, deploy/README.md), і
розділити їх можна було б лише індексуванням шматків. Коміти, які не
збираються, гірші за один великий — тим паче що це рівно той стан, який
перевірявся разом.
ЩО ПРАЦЮЄ НА СТЕНДІ Й ПЕРЕВІРЕНО ТАМ
0058 подієві алерти: syslog, ncm, compliance спрацьовують у мить
події; правило з нереалізованим джерелом більше не зберігається
мовчки
0059 snmp.walk і прототипи шаблонів — таблиці з динамічним індексом
описуються шаблоном, а не Go
0060 відкат конфігу: план як різниця, маскування паролів із підписом
плану, обов'язковий контрольний збір, verifying при обриві
0061 кнопки Telegram: довге опитування, авторизація не з callback_data
0062 аудит і архів хостів; тест на AST, що падає на ключі без назви
0063 RLS: три ролі, окремий пул для фонових тактів
0064 строки зберігання даних і сторінка сховища
0065 приймач SNMP-трапів; перевірено справжніми пакетами по дроту,
переклад v1→v2 за RFC 3584 дає правильний OID
0066 ескалації сповіщень
0067 алерт про вичерпання диска
0068 поля заливки конфігу переїхали в каталог профілів
Плюс: 137 тестів вебу з нуля (їх не було взагалі), одинадцять справжніх
вад, знайдених ними й виправлених, і виправлення двох інтеграційних
тестів grpcapi, які мовчки пропускались півтора року.
ЩО ЩЕ НЕ ЗАПУСКАЛОСЬ
netpulse установник: одна команда замість 18 змінних і
593 рядків інструкції
RLS з першого запуску нова інсталяція під політиками одразу;
RLS-EXISTING-INSTALL.md лишається тільки для
старих інсталяцій
.forgejo + CI раннер не зареєстрований
Ці три перевірені компіляцією й міркуванням, але не виконанням.
ГОЛОВНИЙ ВИСНОВОК ДВОХ СЕСІЙ
Зелена перевірка доводить рівно те, що вона перевіряє. Тест ізоляції RLS
був правильний і зелений — і пропустив зламаний вхід, бо перевіряв «чи
не видно чужого», коли зламалось «чи видно своє». Інтеграційні тести
grpcapi були зелені, бо не виконувались. Схема, довідник і протокол
описували те, чого в коді не існувало, і виглядало це як готове.
Тому в кожному завданні цих сесій стояла вимога назвати НЕПОКРИТЕ, а
чотири задачі закінчились не можливістю, а відмовою: правило з
нереалізованим джерелом не зберігається, профіль без команд заливки
каже про це замість мовчазної кнопки, міграція RLS валить сама себе на
таблиці без політики, тест словника аудиту падає на ключі без назви.
Подробиці — HISTORY.md, розділи за 26 і 27 серпня.
108 lines
3.8 KiB
Go
108 lines
3.8 KiB
Go
package grpcapi
|
||
|
||
import (
|
||
"context"
|
||
"time"
|
||
|
||
"github.com/netpulse/netpulse/server/internal/cronx"
|
||
)
|
||
|
||
// scheduleLockKey — окреме advisory-блокування під планувальник бекапів.
|
||
const scheduleLockKey = 0x6e70_6263 // "npbc"
|
||
|
||
// ScheduleBackups ставить бекапи в чергу за розкладом.
|
||
//
|
||
// Раз на хвилину, бо cron дрібніший за хвилину не буває. Кілька
|
||
// екземплярів сервера безпечні: тік бере advisory-блокування, тож
|
||
// розклад розкручує рівно один — інакше кожен хост отримував би стільки
|
||
// завдань, скільки інстансів у кластері.
|
||
func (s *Service) ScheduleBackups(ctx context.Context) {
|
||
t := time.NewTicker(time.Minute)
|
||
defer t.Stop()
|
||
|
||
s.log.Info("планувальник бекапів запущено")
|
||
|
||
for {
|
||
select {
|
||
case <-ctx.Done():
|
||
return
|
||
case <-t.C:
|
||
if n := s.scheduleTick(ctx); n > 0 {
|
||
s.log.Info("бекапи поставлено в чергу за розкладом", "хостів", n)
|
||
}
|
||
}
|
||
}
|
||
}
|
||
|
||
func (s *Service) scheduleTick(ctx context.Context) int {
|
||
conn, err := s.store.WorkerPool().Acquire(ctx)
|
||
if err != nil {
|
||
s.log.Error("планувальник: з'єднання", "err", err)
|
||
return 0
|
||
}
|
||
defer conn.Release()
|
||
|
||
var got bool
|
||
if err := conn.QueryRow(ctx, `SELECT pg_try_advisory_lock($1)`,
|
||
int64(scheduleLockKey)).Scan(&got); err != nil {
|
||
s.log.Error("планувальник: блокування", "err", err)
|
||
return 0
|
||
}
|
||
if !got {
|
||
// Розклад розкручує інший інстанс — штатний стан.
|
||
return 0
|
||
}
|
||
defer func() {
|
||
_, _ = conn.Exec(context.WithoutCancel(ctx),
|
||
`SELECT pg_advisory_unlock($1)`, int64(scheduleLockKey))
|
||
}()
|
||
|
||
due, err := s.store.DuePolicies(ctx, 200)
|
||
if err != nil {
|
||
s.log.Error("планувальник: вибірка розкладів", "err", err)
|
||
return 0
|
||
}
|
||
|
||
now := time.Now()
|
||
queued := 0
|
||
|
||
for _, d := range due {
|
||
sched, err := cronx.Parse(d.Cron)
|
||
if err != nil {
|
||
// Некоректний розклад не має зупиняти решту й не має
|
||
// повторюватись щохвилини у журналі: відсуваємо політику на
|
||
// добу, щоб скарга лишилась помітною, але не набридала.
|
||
s.log.Warn("некоректний розклад бекапу",
|
||
"device", d.DeviceID, "cron", d.Cron, "err", err)
|
||
_ = s.store.SetNextBackup(ctx, d.DeviceID, now.Add(24*time.Hour))
|
||
continue
|
||
}
|
||
|
||
next, err := sched.Next(now)
|
||
if err != nil {
|
||
s.log.Warn("розклад без найближчого запуску",
|
||
"device", d.DeviceID, "cron", d.Cron)
|
||
_ = s.store.SetNextBackup(ctx, d.DeviceID, now.Add(24*time.Hour))
|
||
continue
|
||
}
|
||
|
||
// Спершу переносимо позначку, потім ставимо завдання.
|
||
//
|
||
// Саме в такому порядку: якщо процес упаде між двома кроками,
|
||
// хост пропустить один бекап. Зворотний порядок дав би
|
||
// нескінченну чергу однакових завдань — а це гірше, бо кладе
|
||
// й пристрій, і сервер.
|
||
if err := s.store.SetNextBackup(ctx, d.DeviceID, next); err != nil {
|
||
s.log.Error("планувальник: перенесення розкладу", "err", err)
|
||
continue
|
||
}
|
||
|
||
if _, err := s.store.EnqueueConfigJob(ctx, d.TenantID, d.DeviceID, "schedule", ""); err != nil {
|
||
s.log.Error("планувальник: постановка завдання",
|
||
"device", d.DeviceID, "err", err)
|
||
continue
|
||
}
|
||
queued++
|
||
}
|
||
return queued
|
||
}
|