{ "index": 239, "slug": "editorial-2021-05-mechanism-distributed-locks", "title": "Почему distributed lock не защищает позднюю запись", "excerpt": "Lease координирует владельцев, но не останавливает проснувшийся процесс. Разбираем fencing token, атомарную проверку на ресурсе и диагностику stale write.", "contentHtml": "
В журнале появляется странная последовательность: worker-A получил lock, надолго замолчал, worker-B получил тот же ресурс и записал новый результат, а затем A проснулся и тоже получил успешный ответ на запись. В базе снова лежит старое значение. В очереди возникла повторная команда. Внешний API принял действие от процесса, который уже не владел именем ресурса.
\nЦена ошибки — не только одна неверная строка. Команда может решить, что lock-сервис выдал два владения одновременно, увеличить TTL и оставить настоящую дыру. Старый процесс не обязан знать, что его lease истёк. Проверка «lock был захвачен в начале» не защищает операцию, которая завершается позже.
\nТезис: lease отвечает за координацию владельцев, а fencing token защищает финальную запись. Ресурс должен хранить последнее принятое поколение и атомарно отклонять запрос с меньшим или равным token. Все worker, lease, token и времена ниже учебные: пример не запускает etcd, Redis, ZooKeeper, базу или сеть.
\nLock authority отвечает: «кому сейчас выдано владение именем?» Он может выдать lease-1 worker-A, дождаться expiry и выдать lease-2 worker-B. Lease ограничивает время владения. Keepalive продлевает его только пока authority получает подтверждения.
\nЗащищаемый ресурс отвечает иначе: «можно ли этому запросу изменить моё состояние после уже принятого поколения?» Ресурсом может быть строка в базе, объектное хранилище, файл или сервер, который принимает команду. Если он не проверяет поколение сам, наличие lock в другом сервисе не влияет на его решение.
\n| Событие | Знает authority | Знает ресурс | Действие |
|---|---|---|---|
| A получил token 1 | lease-1 активен | ничего | передать token вместе с записью |
| lease-1 истёк | имя доступно | A всё ещё может ждать | не считать A остановленным |
| B получил token 2 | lease-2 активен | ничего | передать token вместе с записью |
| ресурс принял token 2 | может не участвовать | highest token равен 2 | сохранить новое значение |
| поздний запрос A с token 1 | может видеть lease-2 | token 1 устарел | отклонить запись |
Ресурсу не нужно снова спрашивать authority, жив ли lease-A. Такой запрос добавляет сетевой вызов и новую гонку. Достаточно собственного факта: token 2 уже принят для этого resource key. Это узкая гарантия. Она не останавливает A и не делает всю бизнес-операцию exactly-once.
\nПри каждом новом захвате authority выдаёт монотонное поколение. Token 1 относится к lease-A, token 2 — к lease-B. Request несёт token до точки, где появляется эффект. Ресурс хранит acceptedFenceToken. Условие записи выглядит так:
function write(resource, request) {\n if (request.fenceToken <= resource.acceptedFenceToken) {\n return { status: 'rejected-stale-fence' };\n }\n resource.acceptedFenceToken = request.fenceToken;\n resource.value = request.value;\n return { status: 'accepted' };\n}\nЭто псевдокод. В SQL условие и присваивание должны быть одной операцией, например UPDATE ... SET value = $1, fence_token = $2 WHERE id = $3 AND fence_token < $2. По числу изменённых строк видно, принял ли ресурс запрос. Отдельное чтение token, пауза и последующий write оставляют ту же гонку.
Строгое сравнение важно. Равный token не делает request новым. Повтор доставки с тем же token требует отдельного operationId и идемпотентного журнала. ownerId показывает автора, leaseId связывает release с конкретным захватом, fenceToken задаёт порядок поколений, а operationId различает повторы одной операции.
Пусть A получил token 1 и начал расчёт. Расчёт должен был занять меньше lease, но процесс остановился на сборке мусора или на медленном вызове базы. Lease истёк. B получил token 2, закончил расчёт и записал v2. A продолжил работу и отправил уже вычисленный v1.
t=0 A: acquire(resource-7) -> lease-A, token=1\nt=5 A: compute() -> процесс остановился\nt=10 authority: lease-A expired\nt=11 B: acquire(resource-7) -> lease-B, token=2\nt=12 B: write(v2, token=2) -> accepted; highest=2\nt=13 A: write(v1, token=1) -> rejected; highest=2\nНебезопасный ресурс делает иначе:
\nresource.value = 'v2'; // B\nresource.value = 'v1'; // A: поздняя запись проходит\nЗдесь ресурс не знает о lock и не отличает старый запрос от нового. Лог о том, что A когда-то владел lock, не исправит данные после записи. Если API не предоставляет условную запись, версию или серверную проверку, перенесите эффект на контролируемую транзакционную границу либо явно примите, что lock только координирует работу.
\n| Симптом | Причина | Проверка | Действие |
|---|---|---|---|
| Старый worker получил 200 после нового | ресурс не проверяет token | сравнить token запроса и highest token | добавить атомарный reject stale write |
| Старый release снял lock B | release проверяет только имя | сверить owner, leaseId и token текущего захвата | отклонять старый handle |
| После retry получился duplicate | fencing принят за идемпотентность | найти operationId и журнал эффекта | добавить идемпотентный контракт отдельно |
| Растёт доля busy | lease не продлевается или ресурс долго занят | разделить acquire, keepalive и write latency | настроить TTL по измерениям, не скрывать отказ |
| Нет token в запросе ресурса | граница защиты осталась в authority | проследить поля до финального write | передавать и сохранять поколение на ресурсе |
resource key и финальный write, который создаёт риск. Не прячьте несколько ресурсов за одним общим lock name.stale, а не успешный ответ или общий timeout.Fencing не отзывает уже выполняющийся код. Он не отменяет запрос, ушедший без проверки, и не исправляет запись, принятую до добавления правила. Он не гарантирует согласованность между двумя независимыми ресурсами. Для нескольких записей нужна общая транзакционная граница, протокол саги или другая выбранная модель.
\nKeepalive сокращает вероятность expiry во время нормальной работы, но не доказывает, что поздний request безопасен. Между подтверждением lease и финальным write остаются паузы, сетевые разрывы и очереди. Provider key тоже не становится fencing token автоматически: важны порядок поколений и проверка на стороне получателя.
\nУчебные фрагменты не дают production-результатов. Они не измеряют задержки, clock drift, SLA, пропускную способность или поведение кластера. Проверяемый критерий готовности таков: после принятого token 2 любой запрос с token 1 получает явный stale-результат, значение ресурса остаётся результатом token 2, а старый release не меняет lease B.
\n