Defined Icon
BLOG

Sprawdziliśmy, czy „darmowe” dane adresowe z OpenStreetMap nadają się do produkcji. Ile naprawdę kosztuje ich jakość

Algolytics - Stylizowana mapa miasta pokazuje gęstą sieć ulic, turkusową rzekę wijącą się przez środek oraz zielone tereny parkowe.

Porównaliśmy blisko 8,4 mln adresów z OpenStreetMap z referencyjnym słownikiem adresowym Algolytics, używanym produkcyjnie w telekomunikacji, finansach i logistyce. Sprawdziliśmy, czy bezpłatny dostęp do danych oznacza gotowość do produkcji - w czterech wymiarach: kompletności, poprawności, aktualności, heterogeniczności. W tym artykule wyjaśniamy, dlaczego powstał raport, jak go przygotowaliśmy, jakie płyną z niego wnioski oraz ile realnie kosztuje doprowadzenie „darmowych” danych do jakości produkcyjnej.

Dlaczego przeprowadziliśmy analizę?

Firmy, które potrzebują ogólnopolskiego słownika adresowego, naturalnie rozważają wykorzystanie danych dostępnych bezpłatnie - takich jak OpenStreetMap czy rejestry publiczne. Na pierwszy rzut oka wydaje się, że skoro dane adresowe są publicznie dostępne, zbudowanie na nich własnej bazy referencyjnej to prosty sposób na ograniczenie kosztów.

Natomiast czy bezpłatny dostęp do danych oznacza gotowość do ich produkcyjnego wykorzystania? OpenStreetMap świetnie sprawdza się w zastosowaniach mapowych, analitycznych i lokalizacyjnych. Inne wymagania pojawiają się jednak wtedy, gdy dane mają działać jako ogólnopolski, produkcyjny słownik adresowy w procesach automatycznych - w formularzach sprzedażowych, systemach CRM, procesach logistycznych, scoringowych czy antyfraudowych. Wtedy liczy się kompletność pól, zgodność z polskim modelem adresowym, stabilność identyfikatorów, aktualność oraz przewidywalność jakości w skali całego kraju.

Dlatego zamiast opierać się na intuicji, porównaliśmy dane adresowe OSM z referencyjnym słownikiem adresowym Algolytics - bazą utrzymywaną produkcyjnie od ponad 10 lat. Celem nie było wykazanie, że OSM nie ma wartości; przeciwnie, to bardzo użyteczny zasób. Chcieliśmy sprawdzić, czy może pełnić tę samą funkcję co słownik produkcyjny: stabilnej, kompletnej i regularnie aktualizowanej bazy referencyjnej dla procesów biznesowych.

Jak przeprowadziliśmy analizę?

Punktem wyjścia były wszystkie obiekty OSM (punktowe i poligonowe) z wypełnionym co najmniej jednym tagiem adresowym „addr” - łącznie ponad 8,6 mln rekordów (stan na czerwiec 2026). Zanim mogliśmy ocenić ich jakość, musieliśmy doprowadzić je do wspólnej, uporządkowanej postaci zgodnej z polskim modelem adresacji: nazwa miejscowości, ulica, numer budynku i kod pocztowy.

Największym wyzwaniem był niejednoznaczny tag addr:place, który - wbrew zaleceniom stowarzyszenia OSM - raz oznacza nazwę ulicy, raz miejscowości, a raz jej części. Dotyczył ponad 3 mln rekordów. Do ich uporządkowania wykorzystaliśmy standaryzację usługą Data Quality (Algolytics). Po usunięciu rekordów bez numeru budynku, połączeniu reprezentacji punktowej i poligonowej oraz deduplikacji (ponad 211 tys. duplikatów) w zbiorze pozostało 8 392 914 rekordów.

Jako punkt odniesienia posłużył referencyjny słownik adresowy Algolytics (stan na 15.04.2026), zawierający 8 803 386 obecnie funkcjonujących adresów. Budujemy go od ponad 10 lat w oparciu o rejestry EMUiA, TERYT i spis PNA oraz inne źródła publiczne, z własnymi procedurami kontroli jakości, uzupełniania braków i obsługi wyjątków, aktualizując go w stałych, kwartalnych interwałach. To baza, na której standaryzujemy ponad 600 mln adresów rocznie przy ponad 99% poprawności.

Dane OSM porównaliśmy do słownika Algolytics w czterech wymiarach: kompletności (ile adresów pokrywa się z bazą referencyjną), poprawności (czy pola adresowe są zgodne, czy położenie współrzędnych jest dokładne), aktualności (kiedy dane były ostatnio modyfikowane) oraz heterogeniczności (czy jakość jest jednorodna w skali kraju).

Jakie główne wnioski płyną z analizy?

Pięć obserwacji uznaliśmy za kluczowe:

  • Ponad 2 mln rekordów wymaga uzupełnienia lub poprawy. OSM zawiera o ponad 410 tys. adresów mniej niż słownik Algolytics. 7% adresów (~617 tys.) w ogóle nie ma odwzorowania w OSM, a spośród dopasowanych 17,5% (~1,4 mln) różni się w co najmniej jednym polu adresowym.
  • Poprawność wygląda dobrze tylko do momentu, gdy sięgniemy po identyfikatory i kody pocztowe. Pełna zgodność pól tekstowych wynosi 82,5%, ale po uwzględnieniu identyfikatorów TERYT spada do 36,2% - a bez stabilnych identyfikatorów rozróżnienie powtarzających się nazw (54,5% miejscowości w Polsce ma nazwę nieunikalną) jest bardzo utrudnione. Najsłabszym polem adresowym są kody pocztowe: błędne średnio w ok. 13% adresów (w województwie lubuskim niemal w 32%).
  • Dane bywają nieaktualne, bo aktualizują je wybiórczo wolontariusze. Niemal 45% rekordów nie było modyfikowanych po 2019 roku. Aktualizacje zależą od aktywności społeczności, a nie od stałego procesu - potrafią objąć nawet tylko fragment jednej miejscowości (jak w Bolestraszycach, gdzie po zmianie adresacji z lutego 2026 część adresów w OSM wciąż odzwierciedlała nieobowiązujący już stan).
  • Dokładność położenia to mocna strona OSM. Ponieważ współrzędne w dużej mierze pochodzą z rejestru EMUiA, mediana błędu wynosi ok. 3 m, a rozbieżności powyżej 50 m dotyczą mniej niż 1% rekordów. Pokazuje to, że wyzwaniem nie jest sama precyzja współrzędnych, lecz kompletność, aktualność i poprawność pól adresowych.
  • Najważniejszy wniosek: jakość OSM jest skrajnie nierówna. Dane nie rozkładają się równomiernie w przestrzeni - na poziomie gmin pełne, poprawne odwzorowanie pól waha się od 0% do 100%, a jednocześnie żadna gmina w Polsce nie odwzorowuje kompletnie wszystkich adresów ze słownika referencyjnego. Dobra jakość w jednym regionie nie gwarantuje jej w innym, dlatego średnia ogólnopolska nie wystarcza do oceny ryzyka.

Ile naprawdę kosztuje „darmowy” słownik adresowy?

Bezpłatny dostęp do danych nie oznacza braku kosztów. Aby dane OSM mogły działać jak produkcyjny słownik, trzeba je znormalizować, uzupełnić o kody TERYT i pocztowe, poprawić błędy oraz utrzymywać w czasie. W skali kraju to ponad 600 tys. braków do uzupełnienia, ponad 1,4 mln rekordów do poprawy i ok. 60 tys. do korekty położenia - łącznie ok. 2,05 mln rekordów.

Żeby ułatwić firmom oszacowanie kosztów, rozpisaliśmy wymagane czynności - od pozyskania i normalizacji danych, przez uzupełnienie identyfikatorów TERYT i kodów PNA, po wykrywanie i poprawę błędów oraz bieżące utrzymanie - na roboczodni (MD) przy założonej stawce 800 zł netto za 1 MD. W sumie oszacowaliśmy prace na ok. 27 roboczodni: samo pierwsze przygotowanie danych to koszt ok. 22 000 zł, a każda kwartalna aktualizacja - kolejne ok. 7 100 zł na utrzymanie jakości.

Po zsumowaniu całkowity koszt posiadania (TCO) w perspektywie 5 lat wynosi ok. 156 900 zł - składa się na niego jednorazowe przygotowanie danych (22 000 zł) oraz cykliczne aktualizacje (ok. 134 900 zł). Stąd nasz najważniejszy wniosek: decyzję o wykorzystaniu OSM warto podejmować nie na podstawie ceny pobrania danych (zerowej), lecz całkowitego kosztu doprowadzenia ich do jakości produkcyjnej i utrzymania w czasie. „Darmowe dane” nie zawsze oznaczają darmowe rozwiązanie.

W czym może pomóc Ci lektura raportu?

Raport potraktowaliśmy jako narzędzie decyzyjne. Jego lektura pozwala:

  • ocenić, czy dane OSM realnie spełniają wymagania Twojego procesu;
  • oszacować własny koszt (TCO) doprowadzenia i utrzymania danych, podstawiając w wyliczeniu własne stawki i zakres prac;
  • zrozumieć ryzyko regionalne - jakość OSM różni się między województwami i gminami, więc średnia krajowa może być myląca dla firmy działającej lokalnie;
  • świadomie podjąć decyzję „build vs buy” - czy budować i utrzymywać własny słownik z darmowych źródeł, czy skorzystać z gotowej bazy produkcyjnej.

Co zawiera pełen raport?

Raport prowadzi czytelnika od kontekstu, przez metodykę i wyniki, aż po koszty:

  • czym są dane adresowe OSM i jak rozumieć ich jakość - od modelu tagów po przygotowanie zbioru do analizy;
  • dlaczego same rejestry publiczne nie wystarczają - jak działa EMUiA i skąd biorą się braki oraz błędy, m.in. w kodach pocztowych;
  • jak zbudowany jest referencyjny słownik adresowy Algolytics i gdzie działa produkcyjnie;
  • pełną analizę jakości OSM: aktualność, kompletność, poprawność, dokładność położenia oraz heterogeniczność;
  • szczegółowe statystyki w podziale na 16 województw oraz mapy jakości na poziomie gmin;
  • pełne wyliczenie kosztów: listę czynności, szacunek roboczodni oraz TCO w perspektywie 5 lat.

Do kogo kierujemy raport?

Opracowanie adresujemy do osób odpowiadających za jakość danych adresowych oraz automatyzację procesów: architektów i inżynierów danych, analityków, zespołów logistyki, e-commerce, CRM i operacji, a także decydentów IT - w branżach takich jak finanse, telekomunikacja, ubezpieczenia, logistyka, e-commerce czy retail. Krótko mówiąc: wszędzie tam, gdzie firma rozważa oparcie procesów na darmowych danych adresowych i chce policzyć, ile naprawdę będzie ją to kosztować.

Dostęp do raportu

Pełny raport „Darmowy słownik adresowy z OpenStreetMap - ile naprawdę kosztuje jakość produkcyjna” udostępniamy bezpłatnie pod tym adresem. Znajdziesz w nim pełną metodykę, szczegółowe statystyki regionalne, analizę aktualności i dokładności położenia oraz wyliczenie kosztów (TCO, 5 lat). W razie pytań lub chęci omówienia wyników - zachęcamy do kontaktu.

Gotowy, aby rozwinąć swój biznes z Machine Learning & AI?

Zacznij wykorzystywać możliwości uczenia maszynowego i sztucznej inteligencji w swoim biznesie i osiągaj wymierne korzyści biznesowe - wzrost sprzedaży, ograniczenie kosztów i efektywność operacyjną.

Skontaktuj się z nami, a wspólnie opracujemy nowoczesną strategię zarządzania procesami biznesowymi w Twojej firmie.

Odkryj inne nasze artykuły