Что изменилось: Технический разбор уточняет масштаб майского сбоя и объясняет, почему первые ограничения трафика не помогли: сборщик данных не попал в выборку, куда брали один запрос из 128. Прошлый пост

Фонд Wikimedia, организация, поддерживающая Википедию, описал, как при майском сбое инженеры пропустили один из источников перегрузки сервиса запросов к данным Wikidata. Сборщик данных не попал в выборку, по которой инженеры ограничивали частоту запросов.

Ранее фонд предположил, что трафик агентов OpenAI мог усугубить этот сбой. Wikidata Query Service — сервис запросов к данным Wikidata.

В мае на пике половина внешних запросов к Wikidata Query Service оставалась без ответа до истечения времени ожидания. Первые правила ограничения трафика инженеры составили по выборке, в которую попадал один из 128 запросов к проектам Wikimedia.

Сбой продолжался все выходные. В понедельник, 11 мая, инженеры нашли пропущенный сборщик по полным журналам сервиса и ограничили его запросы, после чего доля запросов без ответа за отведённое время вернулась к обычному уровню.

Проверка утверждений:

  • Фонд Wikimedia описал, как при майском сбое инженеры пропустили один из источников перегрузки сервиса запросов к данным Wikidata: сборщик данных не попал в выборку, по которой инженеры ограничивали частоту запросов. (подтверждено самой публикацией: доказательство; «Despite the aggressive global edge rate limiting applied on Friday, the outage persisted throughout the weekend. The initial rate-limiting rules were extrapolated from a Turnilo data cube based on a 1-in-128 sample of all incoming web requests across Wikimedia projects. Deeper analysis of WDQS logs (both offline on HDFS and in real time on the nodes themselves) on Monday (2026-05-11) identified a scraper that had not previously been captured by the webrequest sample (Turnilo). Once a requestctl rule was applied to the scraper signatures, query timeout rates returned to baseline.»)
  • Ранее фонд Wikimedia предположил, что трафик агентов OpenAI мог усугубить этот сбой. (подтверждено самой публикацией: доказательство; «Excessive data downloading: Agents we believe to be operated by OpenAI made millions of automated requests to our public APIs to access the knowledge on Wikimedia projects, crawled millions of pages (mainly from our projects Wikidata and Wikimedia Commons), and made hundreds of thousands of data queries to the Wikidata Query Service (WQDS). This traffic may have contributed to a partial outage on WQDS in May .»)
  • В мае в Wikidata Query Service на пике половина внешних запросов оставалась без ответа до истечения времени ожидания. (подтверждено самой публикацией: доказательство; «We serve stale data for >20 hours from 6 nodes, and at peak 50% of WDQS external endpoint requests were timing out for users.»)
  • Первые правила ограничения трафика инженеры составили по выборке, в которую попадал один из 128 запросов к проектам Wikimedia. (подтверждено самой публикацией: доказательство; «The initial rate-limiting rules were extrapolated from a Turnilo data cube based on a 1-in-128 sample of all incoming web requests across Wikimedia projects.»)
  • Сбой продолжался все выходные. (подтверждено самой публикацией: доказательство; «Despite the aggressive global edge rate limiting applied on Friday, the outage persisted throughout the weekend.»)
  • В понедельник, 11 мая, инженеры нашли пропущенный сборщик по полным журналам сервиса и ограничили его запросы, после чего доля запросов без ответа за отведённое время вернулась к обычному уровню. (подтверждено самой публикацией: доказательство; «Deeper analysis of WDQS logs (both offline on HDFS and in real time on the nodes themselves) on Monday (2026-05-11) identified a scraper that had not previously been captured by the webrequest sample (Turnilo). Once a requestctl rule was applied to the scraper signatures, query timeout rates returned to baseline.»)

Публикации:

Первоисточники:

оценка 50,7 из 100 · тип: инцидент