Performance evaluation of the variety of Linked Data Interfaces

Gerealiseerd door: Sebastiaan Delodder
Interne promotor: Dr. ir. Ruben Taelman
Prof. dr. ir. Ruben Verborgh
Academiejaar: 2025-2026
Prijzen: Voorgedragen voor de Baekelandprijs 2026

Via Linked Data kunnen gestructureerde gegevens op het web beschikbaar worden gesteld en met SPARQL worden opgevraagd. Daarbij wordt informatie doorgaans voorgesteld met het Resource Description Framework (RDF) en bevraagd met SPARQL. Naarmate datasets groter worden en meer gebruikers gelijktijdig gegevens opvragen, neemt ook de benodigde verwerking toe. De manier waarop een Linked Data-interface deze verwerking verdeelt over client, server en netwerk heeft daardoor een rechtstreekse invloed op de prestaties.
Verschillende interfaces pakken dit op een andere manier aan. Een SPARQL-endpoint voert het grootste deel van een query uit op de server, terwijl een datadump de verwerking naar de client verschuift. Fragment- en partitie-gebaseerde technieken bevinden zich tussen deze twee uitersten. Hierdoor kan de belasting op één plaats afnemen, maar vaak ten koste van extra verwerking, geheugengebruik of netwerkverkeer elders. Bestaande studies evalueren deze interfaces bovendien vaak met verschillende datasets, implementaties en meetmethodes, waardoor hun resultaten moeilijk rechtstreeks vergelijkbaar zijn. Deze masterproef onderzoekt daarom binnen één consistente testomgeving hoe verschillende interfaces de belasting over client, server en netwerk verdelen.
Tien benaderingen worden vergeleken: een SPARQL-endpoint, TPF, QPF, brTPF, SPF, Passage, een HDT-dump, SmartKG, SmartKG+ en WiseKG. Ze worden getest met WatDiv-datasets van ongeveer 1 tot 100 miljoen RDF-triples. Hiervoor wordt een gemeenschappelijke Comunica-clientomgeving gebruikt, die werd uitgebreid met ondersteuning voor SPF, SmartKG, SmartKG+, WiseKG en Passage. Passage werd daarbij gebaseerd op een eerder bestaand prototype. De evaluatie omvat zowel bruteforce metingen met één client als experimenten met een toenemend aantal gelijktijdige clients. Daarbij worden uitvoeringstijd, processor- en geheugengebruik, netwerkverkeer, queryvoltooiing en het effect van caching gemeten.
De resultaten tonen vooral dat elke interface de belasting anders verdeelt. Meer verwerking op de server kan leiden tot snellere antwoorden en minder netwerkverkeer, maar verhoogt de centrale belasting en het risico op time-outs. Meer verwerking op de client vermindert de serverdruk, maar kan het clientgebruik en netwerkverkeer aanzienlijk verhogen. Hybride en partitie-gebaseerde technieken zoeken een evenwicht tussen beide, waarbij hun prestaties sterk afhangen van de query, de data, de planning en de gekozen partitionering structuur. Op basis van deze verschillen wordt ook duidelijk in welke situaties bepaalde interfaces beter aansluiten bij de beschikbare resources en vereisten. De belangrijkste conclusie is daarom dat de beste interface afhangt van de beschikbare rekenkracht, het geheugen, de netwerkcapaciteit en de mogelijkheden om eerder opgehaalde gegevens en tussenresultaten te hergebruiken.