Defined Icon
BLOG

Ukryte koszty wdrożenia usług geokodowania: limity przechowywania wyników, mapowanie pól i zgodność z TERYT. Porównanie 10 usług  

integracja porównanie usług geokodowania i standaryzacji integration comparison of standardization and geocoding services

Gdy usługa dobrze standaryzuje i geokoduje adresy, pozostaje pytanie wdrożeniowe - jak zintegrować ją z własnymi systemami. Liczy się wtedy m.in. to, czy ma tryb wsadowy do dużych wolumenów, czy warunki licencyjne pozwalają utrwalić wyniki w systemach firmy oraz czy zwraca identyfikatory zgodne z TERYT i stały identyfikator punktu. Od tego zależą dwie rzeczy - czy poprawiony adres w ogóle da się przechować i ponownie wykorzystać, oraz jak dobrym kluczem do łączenia danych się okaże.

W tym artykule pokażemy jak 10 różnych usług standaryzacji i geokodowania wypada na tle integracji oraz na co zwrócić uwagę, zanim wybierzesz dostawcę.

Dlaczego o trwałości klucza adresowego decyduje również integracja, a nie tylko jakość? 

W większości procesów adres pełni rolę identyfikatora - to po nim łączymy klienta z historią zamówień, reklamacją czy oceną ryzyka. Żeby jednak mógł tę rolę pełnić, ustandaryzowany adres i jego lokalizacja muszą trafić do systemów firmy i tam zostać (w hurtowni danych, w CRM, w rekordzie operacyjnym). Wynik geokodowania, którego nie wolno przechować, albo którego nie da się jednoznacznie zmapować na polski model adresu, nie będzie trwałym kluczem - nawet jeśli jest określony bardzo dokładnie.

Dlatego w raporcie zestawiliśmy usługi nie tylko według jakości geokodowania i standaryzacji, lecz także według pięciu cech, które bezpośrednio przekładają się na architekturę integracji:

  • model integracji - czy dostęp jest przez REST API, aplikację webową, czy platformę enterprise (często on-premise); 
  • przetwarzanie wsadowe - czy usługa obsługuje wiele adresów naraz, co jest krytyczne przy dużych wolumenach; 
  • przechowanie wyników - czy warunki licencji pozwalają utrwalić rezultat w systemach firmy; 
  • zgodność z TERYT - czy usługa zwraca nazwy i identyfikatory spójne z polskim rejestrem; 
  • identyfikator punktu - czy usługa zwraca stabilny identyfikator, na którym można oprzeć łączenie danych. 
Usługa Integracja Przetwarzanie wsadowe Przechowanie wyników Zgodność z TERYT Identyfikator punktu 
Data Quality Web-app + REST API online Tak - wsadowo i online Możliwe cache’owanie wyników Nazwy i ID zgodne z TERYT Tak - stały w czasie ID punktu adresowego 
Google REST API Po stronie klienta Cache lat/lng ograniczony do 30 dni Brak ID, częściowa zgodność nazw Tak - ID miejsca w ekosystemie Google 
HERE REST API Tak - Batch API v7 (job) Zależne od planu Brak ID, częściowa zgodność nazw Tak - ID obiektu 
Azure Maps REST API Tak - batch search Zależne od warunków Azure Brak ID, częściowa zgodność nazw Tak - ID adresu 
TomTom REST API Tak - Batch Search API Zależne od warunków TomTom Brak ID, częściowa zgodność nazw Tak - ID adresu 
Mapbox REST API Po stronie klienta Temporary: nie / Permanent: bezterminowo Brak ID, częściowa zgodność nazw Tak - ID adresu 
Esri REST API Tak - batch geocoding Zależne od licencji / credits Brak ID, częściowa zgodność nazw Tak - ID adresu 
Precisely Platforma enterprise (często on-prem) + usługi Tak - enterprise / bulk Zależne od modelu wdrożenia Brak ID, częściowa zgodność nazw Tak - ID adresu 
Emapa API Tak - po stronie integracji Zależne od licencji Brak ID, częściowa zgodność nazw Nie 
Locit API Tak - deklarowane wsady Zależne od licencji Nazwy i ID zgodne z TERYT Tak - ID budynku 

Porównanie 10 usług w wymiarze integracji - na podstawie raportu „Adres jako główny klucz do łączenia danych”. 

Czy wolno przechować to, za co zapłaciłeś? 

Nie każdy dostawca pozwala utrwalić współrzędne i ustandaryzowany adres na stałe - a bez tego adres nie może stać się trwałym kluczem.

Najbardziej rejstrykcyjny jest w tym kontekście Google. Warunki Google Maps Platform wprost ograniczają cache wartości długości i szerokości geograficznej do 30 dni. Mapbox rozróżnia wyniki „Temporary” i „Permanent” - tylko te drugie można przechowywać i wykorzystywać długoterminowo. W przypadku HERE, Azure, TomTom, Esri, Precisely, Emapy i Locit możliwość przechowania zależy od planu, licencji lub modelu wdrożenia. Nasza usługa Data Quality dopuszcza cache’owanie wyników.

Jeśli licencja nie pozwala utrwalić rezultatu, każde ponowne użycie adresu wymaga kolejnego odpytania usługi. Generuje to dodatkowy koszt zapytań oraz prowadzi do uzależnienia procesu od dostawcy i jego dostępności. Adres, który trzeba za każdym razem geokodować od nowa, z definicji nie jest stabilnym kluczem.

Zgodność z TERYT i stały identyfikator punktu – dlaczego są istotne i jak wypadają usługi? 

Jeśli adres ma łączyć rekordy między systemami, to potrzebny jest stabilny punkt odniesienia. Składają się na niego dwa elementy. 

Pierwszy to zgodność z rejestrem TERYT - urzędowym rejestrem podziału terytorialnego kraju. Obejmuje on części składowe adresu: miejscowości, ulice i jednostki administracyjne (gmina, powiat, województwo). Kody TERYT są unikalne w skali kraju i niezależne od dostawcy, więc pozwalają normalizować adres oraz łączyć i agregować dane na poziomie ulicy czy gminy. Zwracają je tylko Data Quality i Locit. Pozostałe usługi - Google, HERE, Azure, TomTom, Mapbox, Esri, Precisely i Emapa - nie zwracają identyfikatorów TERYT i zachowują jedynie częściową zgodność nazw.

TERYT nie schodzi jednak do poziomu budynku - „ul. Kwiatowa 1” i „ul. Kwiatowa 15” w tej samej miejscowości mają ten sam komplet identyfikatorów. Do rozróżnienia konkretnego adresu służy drugi element - stały identyfikator punktu. Gdy jest stabilny w czasie, ten sam budynek zawsze otrzymuje ten sam identyfikator, co pozwala łączyć i deduplikować rekordy bez ponownego geokodowania. Google podaje identyfikator działający tylko we własnym ekosystemie (klucz przywiązany do jednej usługi), Data Quality - stały w czasie identyfikator punktu adresowego, Locit - identyfikator budynku, a Emapa nie zwraca go wcale.

Oba elementy się uzupełniają. TERYT porządkuje adres na poziomie ulicy, miejscowości i gminy, a identyfikator punktu wskazuje konkretny budynek. Najmocniejszy klucz powstaje, gdy usługa dostarcza obu tych elementów - w naszym zestawieniu robią to Data Quality i Locit.

Semantyka pól, czyli ukryty koszt integracji 

Nawet gdy usługa zwraca komplet danych, ich użyteczność zależy od tego, jak bardzo zgodne są one z polskim modelem adresacji. To jest największym problemem dla usług globalnych, w których polskie pojęcia administracyjne bywają mapowane na różne pola - co wymusza dodatkową pracę po stronie klienta. 

  • Esri - pole „City” często zachowywało się jak nazwa gminy (czasem z dopiskiem „gmina”), a pola „District” i „Nbrhd” wypełniały się niespójnie, utrudniając budowę stabilnego klucza.
  • Azure Maps i TomTom - pola municipality i municipalitySubdivision potrafią oznaczać gminę, miejscowość albo dzielnicę, a bywają też puste. Obie usługi zwracają czasem kilka wartości (np. kodu pocztowego, miejscowości) rozdzielonych przecinkami w jednym polu, co utrudnia automatyczne budowanie klucza.
  • Google - brak gminy w modelu administracyjnym, nazwy województw i powiatów niezgodne z zapisem TERYT, brak parsowania numeru mieszkania do osobnego pola. Zdarzało się też, że wynik tekstowy wyglądał poprawnie, a współrzędne wskazywały inny budynek.
  • HERE - niejednoznaczność, czy pole „city” zawiera miejscowość, czy gminę, a pole „district” bywało używane w obu znaczeniach. Widoczne były też przypadki zmienionych numerów budynków mimo deklarowanego wysokiego dopasowania.
  • Mapbox - wypadł najsłabiej w obszarach specyficznych dla polskiego modelu, m.in. w obecności gminy w odpowiedzi API oraz obsłudze miejscowości bez podziału na ulice.
  • Precisely (Spectrum) - niejednoznaczna semantyka pól i brak standaryzacji nazw zgodnej z TERYT; w miejscowościach bez ulic usługa błędnie powielała nazwę miejscowości w polu ulicy, doprowadzając do redundancji danych.
  • Emapa - bliżej polskich realiów w podziale administracyjnym, ale bez jednoznacznej oceny jakości dopasowania; nie zwracała kodów TERYT ani nie parsowała numeru mieszkania.
  • Locit - poprawnie oddaje podział administracyjny i pełny zapis adresu (z numerem mieszkania), zwraca identyfikatory TERYT. Naszą uwagę zwróciły dwa zjawiska: komunikaty o brakach w referencji budynków nawet przy najwyższym poziomie geokodowania oraz przepisywanie wartości wejściowych do pól wystandaryzowanych przy braku dopasowania, co w automatyzacji grozi utrwaleniem błędnych danych jako „wystandaryzowanych”.
  • Data Quality - pełna zgodność z TERYT, zwracane identyfikatory, stały w czasie identyfikator adresu i możliwość cache’owania. Usługa obejmuje obecnie Polskę i wybrane kraje Europy Środkowej (m.in. Czechy, Słowację, Rumunię i Węgry), przy czym to dla Polski oferuje najszerszy zakres zwracanych danych oraz najwyższą jakość dopasowania i geokodowania.

Każda standaryzacja, która wymaga dodatkowej logiki mapowania i normalizacji po stronie klienta, to realny koszt wdrożenia - rzadko widoczny w cenniku, za to odczuwalny na etapie integracji i utrzymania.

Na co zwrócić uwagę, wybierając usługę? 

  • Sprawdź warunki przechowywania, zanim wybierzesz dostawcę. Ustal, czy licencja pozwala utrwalić wynik i na jak długo. Ograniczenie typu „cache do 30 dni” albo podział na wyniki „tymczasowe” i „trwałe” może przekreślić plan zbudowania stałego klucza adresowego.
  • Postaw na zakotwiczenie w rejestrze, jeśli adres ma łączyć dane. Identyfikatory i nazwy zgodne z TERYT dają stabilny punkt odniesienia niezależny od jednej usługi. W naszym badaniu zapewniały je tylko Data Quality i Locit.
  • Wliczaj koszt mapowania pól. Przy usługach globalnych semantyka pól administracyjnych bywa niejednoznaczna - zaplanuj czas na pracę normalizującą wynik do polskiego modelu adresacji.
  • Zweryfikuj tryb wsadowy pod swój wolumen. Większość usług obsługuje przetwarzanie wsadowe, ale u części (np. Google, Mapbox) realizuje się je po stronie klienta, co przy dużej skali zmienia architekturę integracji.

Dostęp do raportu 

Pełny raport, wraz z porównaniem usług w pozostałych wymiarach (jakość standaryzacji i geokodowania, zaufanie do etykiet dostawców) i arkuszem symulacji kosztów dodatkowych usług dla 100 tys. przesyłek rocznie, udostępniamy bezpłatnie pod tym adresem. W razie pytań lub chęci omówienia wyników zachęcamy do kontaktu z nami

Gotowy, aby rozwinąć swój biznes z Machine Learning & AI?

Zacznij wykorzystywać możliwości uczenia maszynowego i sztucznej inteligencji w swoim biznesie i osiągaj wymierne korzyści biznesowe - wzrost sprzedaży, ograniczenie kosztów i efektywność operacyjną.

Skontaktuj się z nami, a wspólnie opracujemy nowoczesną strategię zarządzania procesami biznesowymi w Twojej firmie.

Odkryj inne nasze artykuły