{ "index": 264, "slug": "editorial-2020-09-practice-tracing-basics", "title": "Трассировка запроса: как найти задержку по одному trace", "excerpt": "Разбираем разорванный trace: как передать trace context через границу сервисов, связать parent и child span, прочитать waterfall и остановиться, если данных недостаточно.", "contentHtml": "

Сервис отвечает успешно, но один и тот же endpoint то укладывается в 40 миллисекунд, то ждёт почти секунду. В логах есть записи gateway, catalog и inventory. Связать их с одним запросом нельзя: у строк разные идентификаторы, а время запуска не совпадает. Цена ошибки — менять timeout, retry или запрос к базе вслепую. Можно убрать один видимый симптом и оставить настоящую задержку на следующем участке.

\n

Тезис. Трассировка помогает не потому, что добавляет ещё один лог. Она связывает операции в дерево: общий trace-id описывает одну историю, span-id описывает отдельную операцию, а parent-id показывает прямую связь. На транспортной границе сервис должен передать контекст, создать свой span и передать уже его как родителя следующей операции. Если граница не передала контекст, waterfall распадается и вывод о причине задержки становится гипотезой.

\n

Как читать один trace

\n

Представим учебный запрос к каталогу. Gateway принимает HTTP-запрос и создаёт span gateway.handle. Затем он вызывает catalog. Catalog получает trace context, создаёт catalog.lookup с родителем gateway и запускает два дочерних участка: pricing.read и inventory.fetch. Inventory, в свою очередь, вызывает адаптер.

\n

В такой модели один trace содержит пять span. У всех один trace-id. Каждый span имеет собственный span-id. У дочернего span parent-span-id равен идентификатору операции, которая его вызвала. Эта связь важнее красивого имени сервиса: она показывает, кто породил ожидание.

\n
Симптом → причина → проверка → действие
СимптомПричинаПроверкаДействие
Строки лога нельзя собрать в запросКомпоненты создают разные trace-idСравнить trace-id у входящего и исходящего spanПередавать контекст через границу
Child span существует, но parent неизвестенСервис создал span без текущего контекстаПроверить parent-span-id и порядок времениСоздавать child из извлечённого context
Waterfall показывает невозможное перекрытиеСложили вложенные durationПроверить интервалы start/end и вложенностьСчитать critical path, а не сумму всех span
Trace пропал после proxy или очередиCarrier не прошёл через транспортСравнить header до отправки и после полученияПроверить конкретный adapter или carrier
Задержка есть, но причина не виднаНужный участок не создаёт span или не попал в samplingПроверить покрытие, sampling и экспортНе объявлять виновника без следующего сигнала
\n

Контекст передаётся через границу

\n

Внутри одного процесса контекст можно передать аргументом функции или средствами SDK. После HTTP-вызова, сообщения очереди или фоновой задачи получатель сам его не угадает. Для HTTP используется carrier. Один распространённый вариант — W3C traceparent. В версии 00 он содержит version, trace-id, parent-id и trace-flags.

\n
traceparent: 00-0af7651916cd43dd8448eb211c80319c-b7ad6b7169203331-01\n\n// gateway отправляет свой span как parent:\nconst outgoing = \\`00-\\${traceId}-\\${gatewaySpanId}-01\\`;\n\n// catalog создаёт новый span, но сохраняет traceId:\nconst catalogSpan = {\n  traceId,\n  spanId: '00f067aa0ba902b7',\n  parentSpanId: gatewaySpanId,\n};
\n

Код выше — учебный пример. Он не открывает сеть, не заменяет SDK и не доказывает, что конкретный proxy сохранит заголовок. Его задача — показать два инварианта: trace-id остаётся тем же, а текущий span-id меняется на каждой участвующей границе.

\n

Получатель должен проверить формат до использования. Trace-id и parent-id имеют фиксированную длину и не могут быть нулевыми. Неверный header нельзя принимать как доверенный контекст. Если header отсутствует, сервис начинает новую историю или применяет явно заданную политику. Нельзя молча приписывать запрос к случайному trace.

\n
\"Схема
На границе меняется parent span, но trace-id остаётся общим. Схема показывает контракт передачи, а не выполнение реального запроса.
\n

Waterfall показывает путь, а не сумму строк

\n

Пусть в учебном примере gateway.handle идёт от 0 до 240 миллисекунд, catalog.lookup — от 20 до 220, pricing.read — от 30 до 70, а inventory.fetch — от 30 до 200. Внутри inventory адаптер занимает интервал от 100 до 170 миллисекунд. Эти числа придуманы для объяснения и не являются измерениями production.

\n

Pricing и inventory стартуют одновременно. Поэтому конец запроса определяется веткой inventory, а не суммой 40 и 170 миллисекунд. Время parent включает время дочерних span. Если сложить 240, 200, 40, 170 и 70, получится число, которое не описывает ни задержку запроса, ни critical path. Для анализа нужно найти цепочку зависимых операций и отдельно посмотреть участки parent, которые не закрыли child.

\n
\"Учебный
В учебном waterfall поздно завершающаяся ветка inventory определяет критический путь. Вывод применим только при общей шкале времени и корректных parent-child связях.
\n

Порядок действий

\n
  1. Зафиксируйте симптом. Запишите endpoint, примерный диапазон задержки, код ответа, входные условия и время наблюдения.
  2. Выберите одну историю. Найдите trace конкретного запроса по доступному идентификатору. Не смешивайте записи разных попыток.
  3. Проверьте корень. Убедитесь, что root span имеет начало и конец, а его trace-id не меняется внутри истории.
  4. Проверьте границы. Для каждого HTTP-вызова или сообщения сравните отправленный carrier с полученным. Отметьте место, где связь исчезает.
  5. Проверьте parent. У каждого child должен существовать ожидаемый родитель. Временной интервал child не должен выходить за границу parent без отдельного объяснения.
  6. Постройте критический путь. Отделите последовательные операции от параллельных. Не складывайте вложенные duration.
  7. Назовите следующий сигнал. Если самый длинный span — adapter, проверьте его запрос, очередь или внешний ответ. Один span не доказывает причину внутри себя.
  8. Проверьте отрицательную ветку. Если trace отсутствует, sampling исключил запрос или часы расходятся, остановите вывод и соберите недостающий сигнал.
  9. Сравните повтор. Повторите тот же сценарий с теми же входными условиями и убедитесь, что вывод не зависит от одной удачной истории.
\n

Что трассировка не доказывает

\n

Наличие trace-id не означает, что история полная. Sampling может отбросить запрос. Экспорт может задержаться или завершиться ошибкой. Уровень логирования может скрыть событие. Прокси может удалить заголовок. Очередь может использовать другой carrier. Для каждой границы нужна отдельная проверка.

\n

Трассировка также не показывает автоматически бизнес-причину. Длинный span базы может быть следствием блокировки, плохого плана, холодного соединения или внешнего лимита. Название inventory.fetch не различает эти случаи. Следующий шаг должен читать собственный сигнал участка: план запроса, размер очереди, код внешнего ответа или время подключения.

\n

Не помещайте в trace context пароль, токен, email, полный URL с параметрами или тело запроса. Trace-id служит для связи операций. Доступ к trace и правила хранения должны учитывать, что span attributes часто попадают в журналы и хранилища наблюдаемости.

\n

Проверяемый критерий готовности

\n

Разбор готов, если другой инженер может по одному запросу воспроизвести четыре факта: все нужные span имеют общий trace-id; каждая транспортная граница показывает отправленный и полученный context; parent-child связи согласуются с временем; критический путь объясняет задержку без сложения перекрывающихся интервалов. Для найденного участка существует следующий проверяемый сигнал.

\n

Если хотя бы один факт неизвестен, результатом должна быть запись «причина не доказана» и конкретный следующий fetch, лог или измерение. Это не провал метода. Это правильная граница вывода: trace показывает путь запроса, но не разрешает придумывать отсутствующие данные.

\n

Проверяемые источники

\n" }