Wstaw fragment tekstu, aby zobaczyć najbardziej prawdopodobny język i poziom pewności. Detektor przydaje się do sortowania materiałów wielojęzycznych, sprawdzania tłumaczeń, komentarzy, zapytań wyszukiwania oraz przypadkowo wymieszanych treści.
Co oznacza procent pewności
Procent pokazuje, w jakim stopniu wynik odpowiada cechom, które model kojarzy z danym językiem. Nie jest gwarancją poprawności ani stwierdzeniem, że dokładnie tyle procent tekstu jest napisane w tym języku.
Na przykład wynik „hiszpański — 72%, portugalski — 24%” oznacza, że hiszpański wydaje się najbardziej prawdopodobny, ale tekst zawiera cechy bliskiego języka i wymaga weryfikacji. Im krótszy i bardziej neutralny fragment, tym ostrożniej należy interpretować wynik.
Które teksty są rozpoznawane lepiej
Do wiarygodnego określenia wstaw co najmniej kilka pełnych zdań. Tekst powinien zawierać zwykłe słowa i konstrukcje gramatyczne charakterystyczne dla języka.
Wynik zwykle staje się mniej wiarygodny, jeśli we fragmencie dominują:
- jedno lub dwa krótkie słowa;
- imiona osób, marki i produkty;
- adresy URL, adresy e-mail, liczby i numery katalogowe;
- kod programistyczny;
- terminy międzynarodowe;
- transliteracja;
- słowa identyczne w kilku językach;
- tekst w kilku językach jednocześnie.
Słowo menu, imię Anna lub ciąg SEO audit 2026 same w sobie prawie nie dostarczają modelowi językowemu wystarczającego kontekstu.
Język, pismo i kraj to nie to samo
Cyrylica nie oznacza automatycznie języka rosyjskiego, a łacina – angielskiego. Na jednym piśmie może być używanych dziesiątki języków. Ponadto detektor języka zwykle nie jest w stanie wiarygodnie ustalić kraju autora.
Na przykład:
ptoznacza język portugalski;pt-BR— wariant portugalski dla Brazylii;pt-PT— wariant dla Portugalii;sr-Cyrl— serbski w cyrylicy;sr-Latn— serbski w łacinie.
Takie oznaczenia nazywane są tagami językowymi BCP 47. Detektor może określić język główny, ale nie oznacza to, że dokładnie ustalił wariant regionalny lub pismo.
Jak wykorzystać wynik na stronie internetowej
Określenie języka jest przydatne jako wstępna kontrola, ale nie zastępuje konfiguracji witryny.
- Główny język dokumentu HTML wskazuje atrybut
lang, np.<html lang="pl">. - Fragment w innym języku można oznaczyć osobno:
<span lang="en">...</span>. - Do powiązania wersji językowych stron używa się
hreflang; detektor tekstu tego nie sprawdza. - Nie należy automatycznie zmieniać
langanihreflangwyłącznie na podstawie krótkiego fragmentu.
Poprawny atrybut lang pomaga przeglądarkom, czytnikom ekranu, syntezatorom mowy i translatorom prawidłowo przetwarzać tekst.
Przydatne scenariusze
Sprawdzanie witryny wielojęzycznej
Wstaw tekst podejrzanego bloku, jeśli w polskiej wersji strony przypadkowo pozostała angielska, hiszpańska lub inna lokalizacja. Do sprawdzenia całej strony analizuj główne bloki tekstowe oddzielnie, a nie menu, numery katalogowe i kod razem.
Sortowanie wiadomości przychodzących
Detektor pomaga wstępnie rozdzielić opinie, zgłoszenia i zapytania do kolejek językowych. Przy niskiej pewności lepiej skierować wiadomość do ręcznej weryfikacji.
Kontrola tłumaczeń
Można wykryć, że w przetłumaczonym materiale pozostał duży fragment w języku źródłowym. Narzędzie nie ocenia jakości tłumaczenia, gramatyki ani zgodności z oryginałem – określa tylko prawdopodobny język.
Oczyszczanie semantyki
Podczas pracy z wielojęzycznymi słowami kluczowymi detektor pomaga znaleźć zapytania w niewłaściwym języku. Jednosłowne hasła i nazwy marek i tak trzeba sprawdzać ręcznie.
Jak zwiększyć dokładność wyniku
- Użyj spójnego fragmentu składającego się z kilku zdań.
- Usuń adresy URL, numery, kod i powtarzające się elementy pomocnicze.
- Podziel mieszany tekst na bloki językowe i sprawdź je osobno.
- Porównaj nie tylko pierwszy, ale również kolejne prawdopodobne języki.
- Przy zbliżonych wartościach zweryfikuj wynik z native speakerem lub tłumaczem.
Częste błędy interpretacyjne
- Wysoki procent nie oznacza, że tekst jest bezbłędny.
- Określony język nie oznacza określonego kraju.
- Detektor nie potwierdza jakości i kompletności tłumaczenia.
- Nazwa języka nie zastępuje poprawnego tagu BCP 47 dla HTML i integracji.
- Jeden ogólny wynik dla mieszanego tekstu może ukryć drugi język wewnątrz dokumentu.
Często zadawane pytania
Jaka objętość tekstu jest potrzebna?
Nie ma sztywnego uniwersalnego progu. Kilka pełnych zdań zwykle dostarcza więcej cech niż pojedyncze słowo lub nagłówek. Dla krótkiego tekstu wynik należy traktować jako wstępny.
Czy można wykryć dwa języki w jednym tekście?
Narzędzie może pokazać kilka prawdopodobnych opcji, ale niekoniecznie zaznaczy granice każdego języka. Lepiej podzielić mieszane bloki i sprawdzić je oddzielnie.
Czy detektor określa dialekt lub kraj?
Czasami cechy językowe pozwalają sugerować wariant, ale główny wynik zwykle dotyczy języka. Regionu nie można wiarygodnie wywnioskować z samego krótkiego tekstu.
Czy narzędzie może przetłumaczyć lub sprawdzić ortografię?
Nie. Identyfikacja języka, tłumaczenie i sprawdzanie pisowni to różne zadania.
Powiązane narzędzia: Procesor tekstu; Porównywarka różnic; Usuwanie duplikatów.
Oficjalne standardy
- BCP 47 / RFC 5646 — Tags for Identifying Languages: https://www.rfc-editor.org/rfc/rfc5646
- WHATWG HTML — atrybut
lang: https://html.spec.whatwg.org/multipage/dom.html#the-lang-and-xml:lang-attributes
