Авторы исследования сопоставили Corvic AI, колоночный движок запросов, с семью специализированными графовыми СУБД или СУБД с графовым расширением на трёх масштабах графа.

Ни одна система в выборке не была самой быстрой во всех задачах: Ladybug опережала Corvic AI на запросах к ограниченной окрестности, а Corvic AI была быстрее на запросах, которые сканируют или соединяют большую часть графа.

Авторы называют главным различием в своих данных не задержку запросов, а стоимость подготовки данных к запросам: скорость пакетной загрузки различалась на три порядка, от 5,0 тыс. до 4,3 млн строк в секунду.

Их расчёт точки пересечения показывает, что при менее чем примерно 100 тыс. запросов на одно обновление данных разница в загрузке определяет совокупную стоимость.

Проверка утверждений:

  • Авторы исследования сопоставили Corvic AI с семью специализированными графовыми СУБД или СУБД с графовым расширением на трёх масштабах графа. (подтверждено самой публикацией: доказательство; «We benchmark Corvic AI - a purpose-built columnar query engine underlying Corvic’s ontology management layer ("memories")- against seven purpose-built or graph-extension database systems (LoraDB, Ladybug, DuckPGQ, Memgraph, Neo4j, HugeGraph, and FalkorDB) at three graph scales spanning three orders of magnitude.»)
  • Ни одна система в выборке не была самой быстрой во всех задачах: Ladybug опережала Corvic AI на запросах к ограниченной окрестности, а Corvic AI была быстрее на запросах, которые сканируют или соединяют большую часть графа. (подтверждено самой публикацией: доказательство; «Our central finding is that no system in this sample is categorically fastest: a native graph engine (Ladybug) outperforms Corvic AI on narrow, bounded-neighborhood shapes, while Corvic AI is faster on shapes that scan or join a large fraction of the graph»)
  • Авторы называют главным различием в своих данных не задержку запросов, а стоимость подготовки данных к запросам: скорость пакетной загрузки различалась на три порядка, от 5,0 тыс. до 4,3 млн строк в секунду. (подтверждено самой публикацией: доказательство; «The dominant cost differential in our data is not query latency but the cost of making data queryable at all: bulk-ingest throughput varies by three orders of magnitude across engines (5.0k-4.3M rows/s)»)
  • Их расчёт точки пересечения показывает, что при менее чем примерно 100 тыс. запросов на одно обновление данных разница в загрузке определяет совокупную стоимость. (подтверждено самой публикацией: доказательство; «a simple crossover-point calculation shows dominates total cost for any workload with fewer than roughly 105 queries per data refresh.»)

Первоисточники:

оценка 55,5 из 100 · тип: исследование