Список виборців Індії: ETL з перевіркою даних та транслітерацією
Компанія Apriori Data звернулася до нас із завданням зібрати список виборців з усієї Індії. Клієнту потрібні були дані з кожного штату і адміністративного підрозділу. Нам потрібно було не просто зібрати, а й очистити, стандартизувати та перевірити ці дані, звіряючи їх з інформацією з India Post.
Оскільки дані в реєстрах були доступні на 22 різних мовах, нам довелося також зробити їхню транслітерацію на англійську. Завдання полягало в тому, щоб усе це об’єднати в один файл, який можна було б легко оновлювати щороку.
Виклики проєкту зі списком виборців в Індії
Obsługa miliarda rekordów to ogromne zadanie, które wymaga znacznej mocy obliczeniowej i dużej przestrzeni dyskowej. Musieliśmy również zapewnić szybkie pobieranie danych, płynne aktualizacje i kompletność informacji.
Pracowaliśmy z danymi indyjskiego rejestru wyborców zapisanymi w różnych formatach i językach. Większość rekordów znajdowała się w plikach PDF, ale część stanowiły zdjęcia odręcznie wypełnionych formularzy wyborczych w językach, których typowe narzędzia OCR nie potrafiły obsłużyć.
Aby zapewnić dokładność, porównaliśmy dane indyjskich organów wyborczych z rekordami India Post. Weryfikacja list wyborców w Indiach obejmowała imiona, nazwiska i adresy, a różne formaty i struktury danych sprawiły, że proces był dużym wyzwaniem.
Pracowaliśmy z danymi wyborców w 22 językach, z których każdy był charakterystyczny dla innego stanu lub terytorium Indii. Największe problemy sprawiał pendżabski, ponieważ OCR nie potrafił odczytać tekstu z obrazów. Zachowaliśmy język oryginalny, ale musieliśmy także przekształcić dane zapisane innymi alfabetami na znaki łacińskie. Proces wymagał połączenia wiedzy lingwistycznej z zaawansowanymi algorytmami transliteracji.
Як ми зібрали онлайн-список виборців Індії
Pozyskiwanie danych
Wdrożyliśmy niestandardowe moduły do pozyskiwania list wyborców NVSP India w postaci plików PDF i obrazów od organów wyborczych z całych Indii.
Trenowanie maszyn
Nawiązaliśmy współpracę z ekspertami językowymi, aby stworzyć algorytmy uczące nasze systemy rozumienia i przetwarzania 22 języków używanych w Indiach.
Ekstrakcja danych
Opracowaliśmy kod do pozyskiwania danych z plików PDF i wykorzystaliśmy technologię OCR do odczytywania informacji z obrazów formularzy wyborczych.
Standaryzacja
Po pozyskaniu danych oczyściliśmy je, ustandaryzowaliśmy i poddaliśmy transliteracji, aby dostarczyć wszystko w jednolitym formacie.
Walidacja danych
Aby mieć pewność, że dostarczamy prawidłowe dane z indyjskich list wyborców, porównaliśmy ustandaryzowane informacje z danymi dotyczącymi imion, nazwisk i adresów pochodzącymi z India Post.
Coroczne aktualizacje
Monitorujemy aktualizacje list wyborców w Indiach i edytujemy bazę wyborców, uwzględniając najnowsze informacje organów wyborczych oraz India Post.
Технології, які ми використовували в проєкті
AWS
.NET
Tesseract OCR
Результати проєкту зі збору даних про виборців Індії
Наш клієнт тепер має централізовану цифрову базу даних виборців Індії, яка містить понад один мільярд записів з 36 джерел. Дані доступні як рідними мовами, так і в транслітерації на англійську. Цей файл включає 63 повністю перевірені та нормалізовані поля даних:
- Ім'я виборця
- Ім'я родича
- EPIC номер
- Адреса
- Вік
- Стать
- Рік народження
- Рік перегляду виборчого списку
- Назва виборчої дільниці