Pozyskiwanie danych internetowych dla platformy zakupowej części samochodowych opartej na AI

Budowa warstwy danych dla platformy części samochodowych opartej na AI

Przegląd pozyskiwania danych o częściach samochodowych

Klient to firma technologiczna z branży motoryzacyjnej wykorzystująca AI, która tworzy platformę do zakupu części samochodowych. Jej produkt pomaga firmom pozyskiwać oryginalne części zamienne poprzez agregowanie danych katalogowych od wielu producentów i dostawców.

Aby było to możliwe, klient potrzebował ustrukturyzowanego procesu pozyskiwania danych z dużych, publicznych katalogów części samochodowych.

Klient zwrócił się do nas z następującymi oczekiwaniami:

  • Pozyskiwanie danych o częściach samochodowych z wielu publicznych źródeł
  • Grupowanie wyników według producenta
  • Obsługa filtrowania dla rynku europejskiego, np. modeli z kierownicą po prawej stronie
  • Obsługa pozyskiwania danych na dużą skalę przy ścisłych terminach onboardingu i ograniczonym budżecie

Dlaczego było to wymagające

Wielopoziomowa struktura katalogów

Każda strona miała rozbudowaną hierarchię — producent → model → rama → kategoria → podkategoria → część → szczegóły. Pozyskanie kompletnych zbiorów danych wymagało przechodzenia przez wiele poziomów przy jednoczesnym zachowaniu relacji między pojazdami a kompatybilnymi częściami.

Ogromna liczba zapytań

Niektóre źródła wymagały setek wywołań API dla każdego modelu pojazdu. W przypadku dziesiątek tysięcy pojazdów całkowita liczba zapytań przekraczała 60 milionów. Oszacowanie obciążenia infrastruktury, czasu realizacji i kosztów stało się kluczowym zadaniem inżynieryjnym.

Dynamiczne zabezpieczenia API

Jedno z głównych źródeł korzystało z uwierzytelniania opartego na tokenach i kontroli sesji. Standardowa logika scrapingu przestała działać po aktualizacji zabezpieczeń. Musieliśmy symulować zachowanie prawdziwej przeglądarki i zarządzać rotującymi tokenami, aby zapewnić stabilne i nieprzerwane pozyskiwanie danych.

Równoległe terminy realizacji

Platforma miała ściśle określone terminy onboardingu pierwszych klientów. Dane musiały zostać pozyskane, oczyszczone i dostarczone przed tymi terminami. Musieliśmy znaleźć równowagę między testowaniem, stabilizacją i szybkością, nie ryzykując blokad ani nieudanych operacji na dużą skalę.

Masz podobne problemy w swoim projekcie?

Skontaktuj się z nami, aby omówić, jak możemy pomóc Ci zbudować skalowalne pipeline’y danych z katalogów motoryzacyjnych.

Co dostarczyliśmy

Etap pilotażowy pozyskiwania danych

Po zebraniu wymagań stworzyliśmy bezpłatny moduł ładowania i dostarczyliśmy przykładowy zbiór danych z jednego źródła. Pozwoliło to klientowi zweryfikować format danych, spójność pól, logikę grupowania i ogólną użyteczność przed rozpoczęciem pozyskiwania danych na pełną skalę.

Jednocześnie przedstawiliśmy liczbę rekordów objętych zakresem, szacowane terminy, kalkulację budżetu na podstawie przewidywanego wolumenu oraz plan realizacji.

Dopiero po uzgodnieniu wszystkich szczegółów przeszliśmy do formalnej umowy i pełnej realizacji.

Pozyskiwanie danych z wielu katalogów motoryzacyjnych

Projekt rozszerzył się z jednej strony internetowej na wiele dużych źródeł katalogów motoryzacyjnych. Każde z nich wymagało innych filtrów — producenta, regionu, lat produkcji oraz wyłącznie „Genuine Parts”.

Pozyskiwaliśmy dane z wielu platform katalogowych, w razie potrzeby filtrując modele przeznaczone na rynek europejski, ograniczając zakres do nowszych roczników i nadając priorytet wybranym markom, aby dotrzymać terminów i zmieścić się w budżecie.

W miarę jak klient doprecyzowywał priorytety, dostosowywaliśmy zakres i ponownie obliczaliśmy wolumen danych.

Dostarczanie podzielonych plików JSON do S3

Dane były dostarczane w formatach zgodnych z pipeline’ami ingestion klienta.

Dostarczyliśmy ustrukturyzowane eksporty JSON, pliki podzielone na części ułatwiające przetwarzanie oraz bezpośrednie przesyłanie danych do środowiska S3 klienta.

Dzięki temu zespół inżynieryjny klienta mógł od razu rozpocząć budowę wewnętrznych pipeline’ów bez konieczności wykonywania dodatkowych transformacji.

Rezultaty projektu

Umożliwiliśmy klientowi budowę platformy zakupowej dla branży motoryzacyjnej w oparciu o ustrukturyzowane dane katalogowe gotowe do użycia produkcyjnego.

Dzięki etapowemu podejściu — obejmującemu stworzenie bezpłatnego modułu, walidację próbki i ciągłe doprecyzowywanie zakresu — klient uzyskał jasność w zakresie kosztów, terminów i wykonalności technicznej jeszcze przed skalowaniem projektu.

Najważniejsze rezultaty:

  • Dostarczono zweryfikowane próbki danych przed podpisaniem umowy
  • Dynamicznie dostosowywano zakres w celu kontrolowania kosztów infrastruktury
  • Umożliwiono etapowe wdrożenie zgodne z terminami onboardingu klientów platformy
  • Zachowano moduły do ponownego wykorzystania w przyszłości
  • Załadowano do platformy ponad 313 tys. rekordów części samochodowych
Rezultaty pozyskiwania danych z katalogów motoryzacyjnych

Skontaktuj się z nami

support@nannostech.com
+48889712077