{ "index": 264, "slug": "editorial-2020-09-practice-tracing-basics", "title": "Трассировка запроса: как доказать задержку по одному trace", "excerpt": "Разбираем учебный разрыв trace: как проверить traceparent на границах сервисов, не сложить перекрывающиеся span дважды и выбрать следующий измеримый сигнал.", "contentHtml": "

После условного выката дежурный инженер получает два одинаковых запроса: один завершился за 40 миллисекунд, другой ждал почти секунду. Gateway, catalog и inventory записали события, но их нельзя уверенно собрать в одну историю: идентификаторы различаются, а времена запуска не совпадают. Это учебный incident, поэтому числа ниже придуманы для проверки метода, а не выданы за замер production.

\n

Первое действие — взять один запрос и сравнить контекст на каждой границе: какой traceparent отправил gateway, что извлёк catalog и какой span стал родителем следующего вызова. Цена ошибки здесь практическая: если сразу увеличить timeout или retry, можно скрыть потерю контекста и перенести задержку дальше. Задача статьи — показать, какие факты trace доказывает, а где нужен следующий сигнал.

\n

Сценарий: один запрос и пять span

\n

Разберём контролируемую схему. Gateway принимает HTTP-запрос и создаёт корневой span gateway.handle. Он вызывает catalog. Catalog создаёт catalog.lookup как дочернюю операцию и параллельно запускает pricing.read и inventory.fetch. Inventory вызывает inventory.adapter. Так получается пять span в одной простой trace-истории.

\n

trace-id идентифицирует всю историю, а span-id — одну операцию. У каждого span может быть не более одного parent в обычном дереве, но дочерних span может быть несколько. Поэтому имя сервиса ещё ничего не доказывает: нужно проверить идентификаторы, parent-child связь и интервалы start/end. Ниже приведены только значения учебной модели.

\n
Симптом → возможная причина → проверка → действие
СимптомВозможная причинаПроверкаДействие
Строки нельзя собрать в один запросНа границе создан новый root или потерян contextСравнить trace-id во входящем и исходящем spanПроверить extract/inject и carrier
Child есть, но parent неизвестенSpan создан без активного ContextСверить parent-span-id и момент созданияСоздавать child из извлечённого Context
Сумма duration намного больше ответаВложенные или параллельные интервалы посчитали повторноСопоставить start/end и перекрытияИскать критический путь, а не сумму строк
Trace обрывается после proxy или очередиCarrier не прошёл через транспорт либо сработал samplingСравнить заголовок до отправки и после полученияПроверить конкретную boundary и полноту выборки
Самый длинный span не объясняет ответОн перекрывается с поздней веткой или слишком широк внутри себяНайти последний end и следующий внутренний сигналПроверить адаптер, очередь или внешний ответ
\n

Контекст на HTTP-границе

\n

Внутри процесса Context можно передать средствами SDK. После HTTP-вызова или сообщения очереди получатель не угадывает его по имени сервиса. Propagator записывает context в carrier, например в HTTP-заголовки, а принимающая сторона извлекает его обратно. Это две разные операции: inject выполняет отправитель, extract — получатель.

\n

В W3C Trace Context заголовок traceparent версии 00 имеет четыре поля: version, trace-id, parent-id и trace-flags. Для trace-id используется 32 строчных шестнадцатеричных символа, для parent-id — 16; нулевые значения недействительны. При некорректном контексте реализация должна его проигнорировать, а решение о новой root-истории принимает политика инструмента.

\n

Порядок для исходящего HTTP-вызова важен. Получив запрос, catalog сначала извлекает remote context и создаёт свой server span как child. Перед вызовом inventory он создаёт span исходящего обращения, обычно client span, делает его текущим и только потом inject-ит его context в новый carrier. Inventory извлекает carrier и создаёт свой server span. Тогда в исходящем заголовке меняется parent-id текущего вызова, а trace-id сохраняется.

\n
traceparent: 00-4bf92f3577b34da6a3ce929d0e0e4736-00f067aa0ba902b7-01\n\n// Схема операций SDK, без сетевого вызова:\nconst incoming = propagator.extract(request.headers);\nconst serverSpan = tracer.startSpan('catalog.lookup', { parent: incoming });\nconst outgoing = tracer.startSpan('inventory.fetch', { parent: serverSpan });\npropagator.inject(outgoing.context(), requestToInventory.headers);\n\n// На стороне inventory:\nconst remote = propagator.extract(requestToInventory.headers);\nconst inventorySpan = tracer.startSpan('inventory.server', { parent: remote });
\n

Этот фрагмент показывает последовательность, но не является готовым API для конкретного языка: названия методов у SDK различаются. Он также не обещает, что proxy сохранит заголовок. Для воспроизводимой проверки нужно записать carrier непосредственно перед отправкой и сразу после extract на стороне получателя.

\n
\"Схема
На каждой границе создаётся новый span, но при корректной propagation trace-id остаётся общим. Схема показывает контракт, а не сетевой прогон.
\n

Waterfall: путь запроса, а не сумма строк

\n

В учебной модели root gateway.handle идёт от 0 до 240 мс, catalog.lookup — от 20 до 220, pricing.read — от 30 до 70, а inventory.fetch — от 30 до 200. Внутри inventory адаптер занимает интервал от 100 до 170 мс. Pricing и inventory стартуют одновременно, поэтому их duration перекрываются.

\n

Inclusive duration родителя включает работу children. Если сложить 240, 200, 40, 170 и 70, получится 720 мс, хотя root завершается за 240. Это не задержка запроса. Правильный вопрос другой: какая последовательность интервалов удерживает ответ до конца? В этой модели поздний child catalog — inventory, а pricing остаётся параллельной веткой, не входящей в критический путь после 70 мс.

\n

Для этой простой шкалы критическая цепь раскладывается так: 0–20 мс до catalog, 20–30 мс до его children, 30–100 мс до adapter, 100–170 мс работы adapter, 170–200 мс после adapter, 200–220 мс после children и 220–240 мс до ответа. Сумма этих неперекрывающихся участков равна 240 мс. Это разложение относится к выбранной модели; для асинхронных links, retry и разных часов нужен другой анализ.

\n
\"Учебный
Позднее завершение inventory определяет конец ветки catalog. Вложенный adapter уже входит в interval inventory и не должен добавляться второй раз.
\n

Воспроизводимая проверка интервалов

\n

Ниже — самодостаточный пример для Node.js без внешних пакетов. Он проверяет duration, наличие parent и то, какой child catalog завершился последним. Код не строит полноценный trace backend и не учитывает асинхронные links; его граница намеренно ограничена одной согласованной шкалой.

\n
const spans = [\n  { name: 'gateway.handle', parent: null, start: 0, end: 240 },\n  { name: 'catalog.lookup', parent: 'gateway.handle', start: 20, end: 220 },\n  { name: 'pricing.read', parent: 'catalog.lookup', start: 30, end: 70 },\n  { name: 'inventory.fetch', parent: 'catalog.lookup', start: 30, end: 200 },\n  { name: 'inventory.adapter', parent: 'inventory.fetch', start: 100, end: 170 },\n];\n\nconst byName = new Map(spans.map((span) => [span.name, span]));\nconst duration = (span) => span.end - span.start;\nconst invalid = spans.filter((span) => {\n  const parent = span.parent ? byName.get(span.parent) : null;\n  return parent && (span.start < parent.start || span.end > parent.end);\n});\nconst catalogChildren = spans.filter((span) => span.parent === 'catalog.lookup');\nconst latestChild = catalogChildren.reduce((latest, span) =>\n  span.end > latest.end ? span : latest,\n);\n\nconsole.log({\n  rootDuration: duration(byName.get('gateway.handle')),\n  latestCatalogChild: latestChild.name,\n  latestCatalogChildEnd: latestChild.end,\n  invalidParentRanges: invalid.length,\n});\n// { rootDuration: 240, latestCatalogChild: 'inventory.fetch',\n//   latestCatalogChildEnd: 200, invalidParentRanges: 0 }
\n

Результат подтверждает три локальных факта: root длится 240 мс, inventory завершается позже pricing, каждый child находится внутри parent. Одна шкала — условие входных данных, а не вывод программы. Код не подтверждает, что catalog действительно получил traceparent, что sampling сохранил все span или что задержка внутри adapter вызвана базой. Для последнего вывода нужен собственный сигнал adapter.

\n

Порядок действий

\n
  1. Зафиксируйте симптом. Запишите endpoint, диапазон задержки, код ответа, входные условия и время наблюдения.
  2. Выберите одну историю. Найдите конкретный trace по доступному идентификатору. Не смешивайте повторные попытки и записи разных часов.
  3. Проверьте root. Убедитесь, что корневой span имеет start и end, а sampling и экспорт не скрыли критическую часть.
  4. Проверьте transport boundary. Сравните исходящий carrier с тем, что реально извлёк получатель. Отметьте первую границу, где trace-id исчезает.
  5. Проверьте формат. Для W3C context проверьте version, длины полей, строчные hex-символы и запрет нулевых trace-id и parent-id.
  6. Проверьте parent-child. Сверьте ожидаемого родителя и убедитесь, что child не выходит за его интервал в выбранной модели.
  7. Постройте critical path. Отделите последовательные участки от параллельных. Inclusive duration не складывайте со временем вложенного span.
  8. Назовите следующий сигнал. Для широкого span выберите один fetch: запрос адаптера, размер очереди, внешний код ответа, профиль или источник времени.
  9. Повторите проверку. Повторите тот же сценарий после изменения и отдельно проверьте отрицательный путь: потерянный carrier, sampling или невалидный timestamp.
\n

Границы вывода и безопасность

\n

Trace показывает наблюдаемую структуру и интервалы, но не автоматически бизнес-причину. Длинный span базы может быть следствием блокировки, плохого плана, холодного соединения или внешнего лимита. Если span заканчивается после parent, сначала зафиксируйте противоречие: это может быть раннее закрытие, асинхронная работа или неверно выбранная модель связи.

\n

Обычное дерево плохо описывает fan-out, очередь, retry и работу после ответа. Для операций с несколькими причинными источниками могут понадобиться links, а для разнесённых часов — проверка источника времени и допустимой погрешности. Отсутствие span не доказывает отсутствие работы: запись могла не попасть в sampling, экспорт мог задержаться или instrumentation могла не охватить участок.

\n

Не передавайте в trace context пароль, токен, email, тело запроса или полный URL с параметрами. Trace-id нужен для корреляции, а не для хранения полезной нагрузки. Если следующий сигнал содержит персональные данные, применяйте правила доступа и маскирования вашей системы наблюдаемости.

\n

Критерий готовности

\n

Разбор готов, когда для одного проверочного запроса выполнены четыре условия: записи связаны с root и имеют объяснимые parent-child отношения; на каждой транспортной границе указан фактически отправленный и полученный context; критический путь рассчитан без двойного счёта вложенных и параллельных интервалов; после изменения повторён тот же симптом и отрицательный путь. Если один факт неизвестен, честный результат — «причина пока не доказана» и конкретный следующий fetch.

\n

Проверяемые источники

\n" }