Budowa warstwy danych dla platformy części samochodowych opartej na AI
Klient to firma technologiczna z branży motoryzacyjnej wykorzystująca AI, która tworzy platformę do zakupu części samochodowych. Jej produkt pomaga firmom pozyskiwać oryginalne części zamienne poprzez agregowanie danych katalogowych od wielu producentów i dostawców.
Aby było to możliwe, klient potrzebował ustrukturyzowanego procesu pozyskiwania danych z dużych, publicznych katalogów części samochodowych.
Klient zwrócił się do nas z następującymi oczekiwaniami:
- Pozyskiwanie danych o częściach samochodowych z wielu publicznych źródeł
- Grupowanie wyników według producenta
- Obsługa filtrowania dla rynku europejskiego, np. modeli z kierownicą po prawej stronie
- Obsługa pozyskiwania danych na dużą skalę przy ścisłych terminach onboardingu i ograniczonym budżecie
Dlaczego było to wymagające
Wielopoziomowa struktura katalogów
Każda strona miała rozbudowaną hierarchię — producent → model → rama → kategoria → podkategoria → część → szczegóły. Pozyskanie kompletnych zbiorów danych wymagało przechodzenia przez wiele poziomów przy jednoczesnym zachowaniu relacji między pojazdami a kompatybilnymi częściami.
Ogromna liczba zapytań
Niektóre źródła wymagały setek wywołań API dla każdego modelu pojazdu. W przypadku dziesiątek tysięcy pojazdów całkowita liczba zapytań przekraczała 60 milionów. Oszacowanie obciążenia infrastruktury, czasu realizacji i kosztów stało się kluczowym zadaniem inżynieryjnym.
Dynamiczne zabezpieczenia API
Jedno z głównych źródeł korzystało z uwierzytelniania opartego na tokenach i kontroli sesji. Standardowa logika scrapingu przestała działać po aktualizacji zabezpieczeń. Musieliśmy symulować zachowanie prawdziwej przeglądarki i zarządzać rotującymi tokenami, aby zapewnić stabilne i nieprzerwane pozyskiwanie danych.
Równoległe terminy realizacji
Platforma miała ściśle określone terminy onboardingu pierwszych klientów. Dane musiały zostać pozyskane, oczyszczone i dostarczone przed tymi terminami. Musieliśmy znaleźć równowagę między testowaniem, stabilizacją i szybkością, nie ryzykując blokad ani nieudanych operacji na dużą skalę.
Co dostarczyliśmy
Po zebraniu wymagań stworzyliśmy bezpłatny moduł ładowania i dostarczyliśmy przykładowy zbiór danych z jednego źródła. Pozwoliło to klientowi zweryfikować format danych, spójność pól, logikę grupowania i ogólną użyteczność przed rozpoczęciem pozyskiwania danych na pełną skalę.
Jednocześnie przedstawiliśmy liczbę rekordów objętych zakresem, szacowane terminy, kalkulację budżetu na podstawie przewidywanego wolumenu oraz plan realizacji.
Dopiero po uzgodnieniu wszystkich szczegółów przeszliśmy do formalnej umowy i pełnej realizacji.
Projekt rozszerzył się z jednej strony internetowej na wiele dużych źródeł katalogów motoryzacyjnych. Każde z nich wymagało innych filtrów — producenta, regionu, lat produkcji oraz wyłącznie „Genuine Parts”.
Pozyskiwaliśmy dane z wielu platform katalogowych, w razie potrzeby filtrując modele przeznaczone na rynek europejski, ograniczając zakres do nowszych roczników i nadając priorytet wybranym markom, aby dotrzymać terminów i zmieścić się w budżecie.
W miarę jak klient doprecyzowywał priorytety, dostosowywaliśmy zakres i ponownie obliczaliśmy wolumen danych.
Dane były dostarczane w formatach zgodnych z pipeline’ami ingestion klienta.
Dostarczyliśmy ustrukturyzowane eksporty JSON, pliki podzielone na części ułatwiające przetwarzanie oraz bezpośrednie przesyłanie danych do środowiska S3 klienta.
Dzięki temu zespół inżynieryjny klienta mógł od razu rozpocząć budowę wewnętrznych pipeline’ów bez konieczności wykonywania dodatkowych transformacji.
Rezultaty projektu
Umożliwiliśmy klientowi budowę platformy zakupowej dla branży motoryzacyjnej w oparciu o ustrukturyzowane dane katalogowe gotowe do użycia produkcyjnego.
Dzięki etapowemu podejściu — obejmującemu stworzenie bezpłatnego modułu, walidację próbki i ciągłe doprecyzowywanie zakresu — klient uzyskał jasność w zakresie kosztów, terminów i wykonalności technicznej jeszcze przed skalowaniem projektu.
Najważniejsze rezultaty:
- Dostarczono zweryfikowane próbki danych przed podpisaniem umowy
- Dynamicznie dostosowywano zakres w celu kontrolowania kosztów infrastruktury
- Umożliwiono etapowe wdrożenie zgodne z terminami onboardingu klientów platformy
- Zachowano moduły do ponownego wykorzystania w przyszłości
- Załadowano do platformy ponad 313 tys. rekordów części samochodowych