Netpulse_SasS/server/internal/grpcapi/ncm_schedule.go
byrsapty ed8fc831bf Дві сесії роботи: 0058–0068, розгортання однією командою, тести
Один коміт, а не десяток тематичних, свідомо: теми переплетені в
спільних файлах (store.go, docker-compose.yml, deploy/README.md), і
розділити їх можна було б лише індексуванням шматків. Коміти, які не
збираються, гірші за один великий — тим паче що це рівно той стан, який
перевірявся разом.

ЩО ПРАЦЮЄ НА СТЕНДІ Й ПЕРЕВІРЕНО ТАМ

  0058  подієві алерти: syslog, ncm, compliance спрацьовують у мить
        події; правило з нереалізованим джерелом більше не зберігається
        мовчки
  0059  snmp.walk і прототипи шаблонів — таблиці з динамічним індексом
        описуються шаблоном, а не Go
  0060  відкат конфігу: план як різниця, маскування паролів із підписом
        плану, обов'язковий контрольний збір, verifying при обриві
  0061  кнопки Telegram: довге опитування, авторизація не з callback_data
  0062  аудит і архів хостів; тест на AST, що падає на ключі без назви
  0063  RLS: три ролі, окремий пул для фонових тактів
  0064  строки зберігання даних і сторінка сховища
  0065  приймач SNMP-трапів; перевірено справжніми пакетами по дроту,
        переклад v1→v2 за RFC 3584 дає правильний OID
  0066  ескалації сповіщень
  0067  алерт про вичерпання диска
  0068  поля заливки конфігу переїхали в каталог профілів

Плюс: 137 тестів вебу з нуля (їх не було взагалі), одинадцять справжніх
вад, знайдених ними й виправлених, і виправлення двох інтеграційних
тестів grpcapi, які мовчки пропускались півтора року.

ЩО ЩЕ НЕ ЗАПУСКАЛОСЬ

  netpulse            установник: одна команда замість 18 змінних і
                      593 рядків інструкції
  RLS з першого запуску  нова інсталяція під політиками одразу;
                      RLS-EXISTING-INSTALL.md лишається тільки для
                      старих інсталяцій
  .forgejo + CI       раннер не зареєстрований

Ці три перевірені компіляцією й міркуванням, але не виконанням.

ГОЛОВНИЙ ВИСНОВОК ДВОХ СЕСІЙ

Зелена перевірка доводить рівно те, що вона перевіряє. Тест ізоляції RLS
був правильний і зелений — і пропустив зламаний вхід, бо перевіряв «чи
не видно чужого», коли зламалось «чи видно своє». Інтеграційні тести
grpcapi були зелені, бо не виконувались. Схема, довідник і протокол
описували те, чого в коді не існувало, і виглядало це як готове.

Тому в кожному завданні цих сесій стояла вимога назвати НЕПОКРИТЕ, а
чотири задачі закінчились не можливістю, а відмовою: правило з
нереалізованим джерелом не зберігається, профіль без команд заливки
каже про це замість мовчазної кнопки, міграція RLS валить сама себе на
таблиці без політики, тест словника аудиту падає на ключі без назви.

Подробиці — HISTORY.md, розділи за 26 і 27 серпня.
2026-08-27 17:32:49 +03:00

108 lines
3.8 KiB
Go
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

package grpcapi
import (
"context"
"time"
"github.com/netpulse/netpulse/server/internal/cronx"
)
// scheduleLockKey — окреме advisory-блокування під планувальник бекапів.
const scheduleLockKey = 0x6e70_6263 // "npbc"
// ScheduleBackups ставить бекапи в чергу за розкладом.
//
// Раз на хвилину, бо cron дрібніший за хвилину не буває. Кілька
// екземплярів сервера безпечні: тік бере advisory-блокування, тож
// розклад розкручує рівно один — інакше кожен хост отримував би стільки
// завдань, скільки інстансів у кластері.
func (s *Service) ScheduleBackups(ctx context.Context) {
t := time.NewTicker(time.Minute)
defer t.Stop()
s.log.Info("планувальник бекапів запущено")
for {
select {
case <-ctx.Done():
return
case <-t.C:
if n := s.scheduleTick(ctx); n > 0 {
s.log.Info("бекапи поставлено в чергу за розкладом", "хостів", n)
}
}
}
}
func (s *Service) scheduleTick(ctx context.Context) int {
conn, err := s.store.WorkerPool().Acquire(ctx)
if err != nil {
s.log.Error("планувальник: з'єднання", "err", err)
return 0
}
defer conn.Release()
var got bool
if err := conn.QueryRow(ctx, `SELECT pg_try_advisory_lock($1)`,
int64(scheduleLockKey)).Scan(&got); err != nil {
s.log.Error("планувальник: блокування", "err", err)
return 0
}
if !got {
// Розклад розкручує інший інстанс — штатний стан.
return 0
}
defer func() {
_, _ = conn.Exec(context.WithoutCancel(ctx),
`SELECT pg_advisory_unlock($1)`, int64(scheduleLockKey))
}()
due, err := s.store.DuePolicies(ctx, 200)
if err != nil {
s.log.Error("планувальник: вибірка розкладів", "err", err)
return 0
}
now := time.Now()
queued := 0
for _, d := range due {
sched, err := cronx.Parse(d.Cron)
if err != nil {
// Некоректний розклад не має зупиняти решту й не має
// повторюватись щохвилини у журналі: відсуваємо політику на
// добу, щоб скарга лишилась помітною, але не набридала.
s.log.Warn("некоректний розклад бекапу",
"device", d.DeviceID, "cron", d.Cron, "err", err)
_ = s.store.SetNextBackup(ctx, d.DeviceID, now.Add(24*time.Hour))
continue
}
next, err := sched.Next(now)
if err != nil {
s.log.Warn("розклад без найближчого запуску",
"device", d.DeviceID, "cron", d.Cron)
_ = s.store.SetNextBackup(ctx, d.DeviceID, now.Add(24*time.Hour))
continue
}
// Спершу переносимо позначку, потім ставимо завдання.
//
// Саме в такому порядку: якщо процес упаде між двома кроками,
// хост пропустить один бекап. Зворотний порядок дав би
// нескінченну чергу однакових завдань — а це гірше, бо кладе
// й пристрій, і сервер.
if err := s.store.SetNextBackup(ctx, d.DeviceID, next); err != nil {
s.log.Error("планувальник: перенесення розкладу", "err", err)
continue
}
if _, err := s.store.EnqueueConfigJob(ctx, d.TenantID, d.DeviceID, "schedule", ""); err != nil {
s.log.Error("планувальник: постановка завдання",
"device", d.DeviceID, "err", err)
continue
}
queued++
}
return queued
}