Lista wyborców w Indiach: ETL z weryfikacją danych i transliteracją
Firma Apriori Data zwróciła się do NannosTech z prośbą o zebranie list wyborców w Indiach z danych udostępnianych przez organy wyborcze. Klient potrzebował informacji z każdego stanu i jednostki administracyjnej. Dane należało oczyścić, ustandaryzować i zweryfikować na podstawie informacji z India Post.
Informacje w rejestrach były dostępne w 22 językach urzędowych, dlatego musieliśmy również przeprowadzić ich transliterację na język angielski. Celem było połączenie wszystkich danych w jeden łatwo dostępny plik, który można aktualizować każdego roku.
Kluczowe wyzwania projektu listy wyborców w Indiach
Obsługa miliarda rekordów to ogromne zadanie, które wymaga znacznej mocy obliczeniowej i dużej przestrzeni dyskowej. Musieliśmy również zapewnić szybkie pobieranie danych, płynne aktualizacje i kompletność informacji.
Pracowaliśmy z danymi indyjskiego rejestru wyborców zapisanymi w różnych formatach i językach. Większość rekordów znajdowała się w plikach PDF, ale część stanowiły zdjęcia odręcznie wypełnionych formularzy wyborczych w językach, których typowe narzędzia OCR nie potrafiły obsłużyć.
Aby zapewnić dokładność, porównaliśmy dane indyjskich organów wyborczych z rekordami India Post. Weryfikacja list wyborców w Indiach obejmowała imiona, nazwiska i adresy, a różne formaty i struktury danych sprawiły, że proces był dużym wyzwaniem.
Pracowaliśmy z danymi wyborców w 22 językach, z których każdy był charakterystyczny dla innego stanu lub terytorium Indii. Największe problemy sprawiał pendżabski, ponieważ OCR nie potrafił odczytać tekstu z obrazów. Zachowaliśmy język oryginalny, ale musieliśmy także przekształcić dane zapisane innymi alfabetami na znaki łacińskie. Proces wymagał połączenia wiedzy lingwistycznej z zaawansowanymi algorytmami transliteracji.
Jak stworzyliśmy internetową listę wyborców w Indiach
Pozyskiwanie danych
Wdrożyliśmy niestandardowe moduły do pozyskiwania list wyborców NVSP India w postaci plików PDF i obrazów od organów wyborczych z całych Indii.
Trenowanie maszyn
Nawiązaliśmy współpracę z ekspertami językowymi, aby stworzyć algorytmy uczące nasze systemy rozumienia i przetwarzania 22 języków używanych w Indiach.
Ekstrakcja danych
Opracowaliśmy kod do pozyskiwania danych z plików PDF i wykorzystaliśmy technologię OCR do odczytywania informacji z obrazów formularzy wyborczych.
Standaryzacja
Po pozyskaniu danych oczyściliśmy je, ustandaryzowaliśmy i poddaliśmy transliteracji, aby dostarczyć wszystko w jednolitym formacie.
Walidacja danych
Aby mieć pewność, że dostarczamy prawidłowe dane z indyjskich list wyborców, porównaliśmy ustandaryzowane informacje z danymi dotyczącymi imion, nazwisk i adresów pochodzącymi z India Post.
Coroczne aktualizacje
Monitorujemy aktualizacje list wyborców w Indiach i edytujemy bazę wyborców, uwzględniając najnowsze informacje organów wyborczych oraz India Post.
Technologie wykorzystane w internetowym projekcie listy wyborców w Indiach
AWS
.NET
Tesseract OCR
Rezultaty projektu dotyczącego danych wyborców w Indiach
Nasz klient posiada obecnie scentralizowaną cyfrową bazę danych wyborców w Indiach, zawierającą ponad miliard rekordów z 36 źródeł. Dane są dostępne zarówno w językach oryginalnych, jak i w wersji transliterowanej na język angielski. Plik zawiera 63 w pełni zweryfikowane i znormalizowane pola danych:
- Imię i nazwisko wyborcy
- Imię i nazwisko osoby spokrewnionej
- Numer EPIC
- Adres
- Wiek
- Płeć
- Rok urodzenia
- Rok aktualizacji spisu wyborców
- Nazwa lokalu wyborczego