Modele

Falcon-Emirati-7B mówi dialektem z Emiratów. Inne modele odpowiadały językiem z podręcznika

TII wypuścił mały model, który odpowiada w dialekcie emirackim. W testach inne modele, także większe, znały odpowiedzi, ale podawały je w arabskim literackim. To lekcja dla każdego mniejszego języka.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: huggingface.co · jak powstaje
Zdjęcie: otwarty stary słownik, na stronie czerwona figurka sokoła trzyma w dziobie ręcznie zapisaną karteczkę.

Technology Innovation Institute (TII) opublikował 6 października Falcon-Emirati-7B, model językowy, który rozmawia dialektem emirackim zamiast arabskiego literackiego. Najciekawszy jest wynik porównania: inne modele, także większe, często znały poprawną odpowiedź, ale podawały ją w języku z podręcznika, nawet gdy pytanie padło w dialekcie. Opis budowy i testów zespół TII zamieścił na blogu Hugging Face. To historia dla każdego, kto zastanawia się, dlaczego model AI mówi poprawnie, ale „nie po naszemu”.

Jeden język, dwa rejestry

Arabski literacki to język wiadomości i podręczników. W Zjednoczonych Emiratach Arabskich na co dzień mówi się jednak dialektem emirackim, z własnym słownictwem, przysłowiami i poezją. Według autorów dialekt pojawia się w internecie rzadko, bo jest głównie mówiony. Modele uczone głównie na tekstach z sieci mają więc mało materiału w dialekcie.

TII zbudował model na swojej rodzinie Falcon-H1-Arabic, w wersji z 7 mld parametrów. Do treningu wziął trzy rodzaje danych: teksty z emirackich stron i forów pisane dialektem, teksty w języku literackim o emirackiej kulturze i obyczajach oraz dane syntetyczne. Te ostatnie wygenerował inny model, ale pod kontrolą słowników i reguł stylu, żeby brzmiały po emiracku, a nie „ogólnie z Zatoki”.

Wyniki według autorów

Model sprawdzano na teście Alyah: 1173 pytaniach zebranych od rodzimych użytkowników dialektu, od pozdrowień po poezję. Odpowiedzi oceniali też ludzie mówiący po emiracku. Drugą ocenę wystawił model Gemini 3.7 Flash w roli sędziego: sprawdzał, czy odpowiedź jest poprawna i czy padła w dialekcie.

TestFalcon-Emirati-7BPorównanie
Alyah, test wyboru84,83 proc.najwyższy wynik wśród porównanych modeli spoza rodziny Falcon
Wierność dialektowi (0–1)0,52ALLaM 0,05; Gemma 3 27B 0,03; Jais-2-8B 0,02; Fanar-2-27B ok. 0
Kultura ZEA, 283 scenariusze85,57 proc.ALLaM-7B 83,39 proc.; Jais-2-8B 73,79 proc.; Fanar-2-27B 71,50 proc.

Różnica w wierności dialektowi jest największa. Konkurencyjne modele odpowiadały w języku literackim prawie zawsze, także te większe. Fanar-2-27B dodatkowo odmawiał odpowiedzi w 26,2 proc. przypadków, a pozostałe modele poniżej 5 proc. Wniosek autorów jest prosty: sam rozmiar modelu nie daje znajomości dialektu, trzeba go uczyć celowo, na danych z tego dialektu i z własnym testem.

Wszystkie liczby pochodzą od TII, który zbudował i model, i część testów. Niezależnego sprawdzenia wpis nie podaje.

Co z tego wynika poza Emiratami

Autorzy piszą o arabskim, ale ich wniosek, że znajomości odmiany języka nie daje sam rozmiar modelu, to argument za modelami uczonymi pod konkretny język. Pisaliśmy o tym przy Kolibri 1 od Aleph Alpha, który obsługuje niemiecki i angielski, ale nie polski.

Falcon-Emirati-7B można wypróbować w czacie TII pod adresem chat.falconllm.tii.ae. Wpis nie mówi, czy wagi modelu są do pobrania. Autorzy zastrzegają, że model myli się przy rzadkich wyrażeniach i lokalnych odniesieniach, i odradzają używanie go w sprawach urzędowych bez własnych testów.

Źródła
  1. TII, „Falcon-Emirati: When an LLM Learns the Dialect, the Culture, and the Nuance”, blog Hugging Face, dostęp 2026-10-06

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

5 października 2026

Grok 4.7 kosztuje 7,78 zł za milion tokenów wejścia. SpaceXAI celuje w programistów i biura

Modelex.ai3 min
5 października 2026

Kolibri 1 od Aleph Alpha to otwarty model po niemiecku i angielsku. Polskiego nie obsługuje

Modelehuggingface.co3 min
5 października 2026

Cloudflare Clef nie pisze tekstu, tylko wybiera odpowiedź. Otwarty model do sortowania spraw

Modelehuggingface.co2 min