Sunʼiy intellekt oʻzbek tilini nega qiyin oʻrganadi
Model ingliz tilida ravon yozadi, oʻzbekchada esa qoqiladi. Sabab modelning «bilimsizligi» emas: matn hajmi, ikki alifbo, apostrof va soʻz yasalishining oʻzi til uchun toʻsiq yaratadi.

Til modellari bilan ishlagan har bir oʻzbek foydalanuvchi buni sezgan: inglizcha soʻrovga ravon javob keladi, oʻzbekcha soʻrovga esa gohida gʻalati qoʻshimchali, gohida rus tilidan soʻzma-soʻz oʻgirilgandek matn. Buning sabablari texnik va ular yaxshi maʼlum.
Birinchi sabab: matn kam
Model tilni qoidalardan emas, matndan oʻrganadi. Internetdagi matnlarning ulkan qismi ingliz tilida. Oʻzbek tili esa «kam resursli» tillar toifasiga kiradi: raqamli koʻrinishdagi sifatli matn hajmi tartiblar bilan kam. Modelga milliondan bir necha marta kam misol koʻrsatilsa, natija ham shunga yarasha boʻladi.
Ikkinchi sabab: ikkita alifbo
Oʻzbek tili lotin va kirill yozuvida yoziladi. Model uchun bu koʻpincha ikki xil til kabi koʻrinadi: bitta soʻzning ikki yozuvdagi shakli bogʻlanmasligi mumkin. Natijada allaqachon kichik boʻlgan korpus yana ikkiga boʻlinadi va har bir yarmi alohida-alohida yetarli boʻlmay qoladi.
Uchinchi sabab: soʻz uzun, token koʻp
Model matnni soʻzlarga emas, tokenlarga boʻladi. Ingliz tilida koʻpchilik soʻz bitta yoki ikkita tokenga tushadi. Oʻzbek tili agglyutinativ — maʼno oʻzakka ketma-ket qoʻshiladigan qoʻshimchalar bilan yasaladi, va bunday soʻz koʻpincha bir necha boʻlakka parchalanadi.
Buning ikkita amaliy oqibati bor. Birinchisi — narx: API xizmatlari tokenlar soniga qarab hisoblanadi, yaʼni bir xil maʼnodagi oʻzbekcha matn inglizchasidan qimmatroqqa tushadi. Ikkinchisi — sifat: soʻz notoʻgʻri boʻlaklarga ajralsa, model qoʻshimchalarning maʼnosini yomonroq ushlaydi va kelishik xatolari paydo boʻladi.
Toʻrtinchi sabab: apostrof
Kichik, lekin juda oʻjar muammo. Lotin yozuvidagi oʻzbek tilida oʻ va gʻ harflari hamda tutuq belgisi maxsus belgilar bilan yoziladi. Amalda esa foydalanuvchilar oddiy apostrof, teskari tirnoq yoki nashriyot tirnogʻini ishlatadi. Kompyuter uchun bular butunlay boshqa belgilar: bir xil soʻzning bir necha yozilishi paydo boʻladi va qidiruv ularni bogʻlay olmaydi.
Bu nazariy muammo emas. Har qanday oʻzbekcha saytda qidiruvni toʻgʻri ishlatish uchun matnni oldindan meʼyorlashtirish — barcha variantlarni bitta shaklga keltirish kerak boʻladi. Aks holda foydalanuvchi «Oʻzbekiston» deb yozadi, bazada esa «Ozbekiston» saqlangan boʻlib chiqadi.
Nima yordam beradi
Yechim modelni almashtirishda emas, kirish maʼlumotini tartibga solishda. Matnni meʼyorlashtiring, ikki alifbo oʻrtasida ishonchli transliteratsiya qoʻying, soʻrovlarni aniq va toʻliq yozing — kalta soʻrov modelni taxminlar bilan toʻldirishga majbur qiladi. Terminlar muhim boʻlsa, ularni soʻrovning oʻzida keltiring.
Uzoq muddatda esa bitta narsa hal qiladi: ochiq, sifatli va toʻgʻri belgilangan oʻzbekcha matn korpuslari. Til modelga qanchalik koʻp koʻrsatilsa, u shunchalik yaxshi yozadi — bu yerda sehr yoʻq.
