မာတိကာသို့ ခုန်သွားရန်

ဘာသာစကားမော်ဒယ်

ဝီကီပီးဒီးယား မှ

ဘာသာစကားမော်ဒယ် (အင်္ဂလိပ်: Language Model) ဆိုသည်မှာ သဘာဝဘာသာစကား (သို့မဟုတ်) လူသားသုံး ဘာသာစကားများ ၏ စာသားအစီအစဉ်များ (sequences) ကို ကြိုတင်ခန့်မှန်းပေးသည့် ကွန်ပျူတာတွက်ချက်မှုစနစ်သုံး မော်ဒယ်တစ်ခု ဖြစ်သည်။[][] ပညာရှင်များသည် ဘာသာစကားမော်ဒယ်များကို စကားပြောအသံဖတ်စနစ် (speech recognition)၊[] စက်ဖြင့်ဘာသာပြန်ဆိုခြင်း (machine translation)၊[] လူသားကဲ့သို့ စာသားများဖန်တီးပေးသည့် သဘာဝဘာသာစကားထုတ်လုပ်ခြင်း (natural language generation)၊ ရုပ်ပုံဖတ်စာသားပြောင်းစနစ် (optical character recognition)၊ လမ်းကြောင်းရှာဖွေမှု အကောင်းဆုံးဖြစ်အောင်လုပ်ဆောင်ခြင်း (route optimization)၊[] လက်ရေးဖတ်စနစ် (handwriting recognition)၊[] သဒ္ဒါစည်းမျဉ်းရှာဖွေခြင်း (grammar induction)၊[] သတင်းအချက်အလက် ရှာဖွေဖော်ထုတ်ခြင်း (information retrieval)[][] နှင့် သဘာဝဘေးအန္တရာယ် ကာကွယ်တုံ့ပြန်ရေး လုပ်ငန်းစဉ်များ အပါအဝင် ကဏ္ဍမျိုးစုံတွင် အသုံးချကြသည်။.[၁၀]

၂၀၂၆ ခုနှစ် လက်ရှိအချိန်တွင် ၎င်းဘာသာစကားမော်ဒယ်များ၏ အဆင့်မြင့်ဆုံးပုံစံမှာ အဆင့်မြင့် ဘာသာစကားမော်ဒယ်ကြီးများ (Large Language Models - LLMs) ဖြစ်ပြီး၊ ၎င်းတို့ကို (အများပြည်သူသုံး အင်တာနက်စာမျက်နှာများမှ ကူးယူထားသော) ကြီးမားသည့် ဒေတာအစုများပေါ်တွင် လေ့ကျင့်ပေးထားသည့် transformer တည်ဆောက်ပုံစနစ်များဖြင့် အဓိက တည်ဆောက်ထားသည်။ ဤ LLM မော်ဒယ်များသည် ယခင်က အသုံးပြုခဲ့သော recurrent neural network အခြေခံမော်ဒယ်များကို အစားထိုးကျော်လွန်လာခဲ့ခြင်း ဖြစ်သည်။ ၎င်း recurrent neural network မော်ဒယ်များသည်လည်း အတိတ်ကာလက အသုံးပြုခဲ့သည့် word n-gram ကဲ့သို့သော စာရင်းအင်းအချက်အလက် သီးသန့်သုံး မော်ဒယ်များကို အစားထိုးခဲ့ဖူးသည်။

သမိုင်းကြောင်း

[ပြင်ဆင်ရန်]

ပညာရှင် နုမ်းချုမ်းစကီး (Noam Chomsky) သည် ၁၉၅၀ ပြည့်လွန်နှစ်များတွင် သဒ္ဒါစည်းမျဉ်းသီအိုရီ (theory of formal grammars) ကို တီထွင်ပြီး ဘာသာစကားမော်ဒယ်ဆိုင်ရာ လမ်းခင်းပေးသည့် ရှေ့ဆောင်သုတေသနလုပ်ငန်းများကို လုပ်ဆောင်ခဲ့သည်။[၁၁]

၁၉၈၀ ပြည့်နှစ်တွင် ပညာရှင်များသည် စာရင်းအင်းအခြေပြုနည်းလမ်းများ (statistical approaches) ကို စတင်လေ့လာခဲ့ကြပြီး၊ ၎င်းနည်းလမ်းများသည် ရည်ရွယ်ချက်အများစုအတွက် စည်းမျဉ်းအခြေပြု သဒ္ဒါစနစ်များထက် ပိုမိုအသုံးဝင်ကြောင်း တွေ့ရှိခဲ့ကြသည်။ ထိုစဉ်က စကားလုံးများ၏ သီးခြားပေါင်းစပ်မှု ဖြစ်နိုင်ခြေများကို တွက်ချက်သည့် word n-gram ကဲ့သို့သော သီးခြားပြောင်းလဲကိန်းသုံး စနစ်များ (discrete representations) သည် သိသာထင်ရှားသော တိုးတက်မှုများကို ဆောင်ကြဉ်းပေးနိုင်ခဲ့သည်။

၂၀၀၀ ပြည့်လွန်နှစ်များတွင် စကားလုံးများကို ကိန်းဂဏန်းများဖြင့် စဉ်ဆက်မပြတ် ဖော်ပြပေးသည့် စနစ်များ (continuous representations - ဥပမာ - word embeddings) ပေါ်ပေါက်လာပြီး ယခင်က သီးခြားပြောင်းလဲကိန်းသုံး စနစ်များနေရာတွင် အစားထိုးလာခဲ့သည်။[၁၂] ပုံမှန်အားဖြင့် ဤစနစ်သည် စကားလုံးတစ်လုံး၏ အဓိပ္ပာယ်ကို ဗက်တာ (vector) ကိန်းစစ်တန်ဖိုးများဖြင့် ပြောင်းလဲသတ်မှတ်ပေးသည်။ ထိုသို့သတ်မှတ်ရာတွင် ဗက်တာလွင်ပြင် (vector space) ထဲ၌ အနီးကပ်ဆုံးရှိသော စကားလုံးများသည် အဓိပ္ပာယ်ချင်း ဆင်တူကြပြီး၊ စကားလုံးများအကြား ရှိတတ်သော အများကိန်းစနစ် သို့မဟုတ် လိင်ခွဲခြားမှုပုံစံ စသည့် အခြေခံဆက်နွှယ်မှုများကိုလည်း မပျောက်ပျက်အောင် ထိန်းသိမ်းပေးထားသည်။

စာရင်းအင်းအခြေပြု သီးသန့်မော်ဒယ်များ (Pure statistical models)

[ပြင်ဆင်ရန်]

၁၉၈၀ ပြည့်နှစ်တွင် ပညာရှင်များသည် ပထမဆုံးသော ထင်ရှားသည့် စာရင်းအင်းအခြေပြု ဘာသာစကားမော်ဒယ်ကို စတင်တင်ပြခဲ့သည်။ ၎င်းဆယ်စုနှစ်အတွင်း IBM ကုမ္ပဏီသည် 'ရှန်နွန်စတိုင်' (Shannon-style) စမ်းသပ်မှုများကို လုပ်ဆောင်ခဲ့သည်။ ဤစမ်းသပ်မှုတွင် လူသားများက စာသားများကို ကြိုတင်ခန့်မှန်းခြင်း သို့မဟုတ် ပြင်ဆင်ခြင်းတို့ ပြုလုပ်ရာ၌ ပြသသော စွမ်းဆောင်ရည်များကို စောင့်ကြည့်လေ့လာဆန်းစစ်ခြင်းဖြင့် ဘာသာစကားမော်ဒယ် ပိုမိုတိုးတက်ကောင်းမွန်လာစေမည့် အလားအလာရှိသော ရင်းမြစ်များကို ရှာဖွေဖော်ထုတ်နိုင်ခဲ့သည်။[၁၃]

စကားလုံး n-gram အခြေပြု မော်ဒယ်များ

[ပြင်ဆင်ရန်]

စကားလုံး n-gram အခြေပြု မော်ဒယ်များသည် စာရင်းအင်းအခြေပြု ဘာသာစကားမော်ဒယ်များအနက် အခြေခံအကျဆုံးနှင့် သမိုင်းကြောင်းအရ အရေးပါဆုံး မော်ဒယ်များ ဖြစ်ကြသည်။ ဤမော်ဒယ်များသည် စာသားတစ်ခုအတွင်းရှိ စကားလုံးအားလုံးကို တစ်ပြိုင်နက် ဆန်းစစ်မည့်အစား ပေးထားသော စကားလုံးတစ်လုံး၏ ဖြစ်နိုင်ခြေကို ၎င်း၏ ရှေ့တွင် ကပ်လျက်ရှိနေသော စကားလုံး အရေအတွက် (n-1) ခုပေါ်၌သာ အခြေခံ၍ တွက်ချက်သည်။ ဥပမာအားဖြင့် n=2 ဖြစ်ပါက ဘိုင်ဂရမ် (bigram) ဟုခေါ်ဆိုပြီး ရှေ့ကစကားလုံး တစ်လုံးတည်းပေါ် မူတည်၍ နောက်စကားလုံးကို ခန့်မှန်းကာ၊ n=3 ဖြစ်ပါက ထရိုင်ဂရမ် (trigram) ဟုခေါ်ဆိုပြီး ရှေ့ကစကားလုံး နှစ်လုံးပေါ် မူတည်၍ ခန့်မှန်းသည်။ ပညာရှင်များသည် ကြီးမားသော စာစုအချက်အလက်များ (text corpus) ထဲ၌ အဆိုပါ စကားလုံးတွဲများ မည်မျှအကြိမ်ရေ ပါဝင်သည်ကို ရေတွက်ခြင်းဖြင့် ဖြစ်နိုင်ခြေ ရလဒ်များကို တွက်ချက်ယူကြသည်။ သို့သော် ဤမော်ဒယ်များသည် ဝေါဟာရအသစ်များ ပါဝင်လာပါက တန်ဖိုး သုည (zero probability) ဖြစ်သွားတတ်သည့် ပြဿနာရှိသဖြင့် ၎င်းကို ဖြေရှင်းရန် ပျော့ပျောင်းချောမွေ့စေမည့် နည်းလမ်းများ (smoothing techniques) ကို တွဲဖက်အသုံးပြုရသည်။

အညွှန်းကိန်းအခြေပြု မော်ဒယ်များ (Exponential)

[ပြင်ဆင်ရန်]

အမြင့်ဆုံး အင်ထရိုပီ ဘာသာစကားမော်ဒယ်များ (Maximum entropy language models) သည် စကားလုံးတစ်လုံးနှင့် ၎င်း၏ ရှေ့တွင်ရှိခဲ့သော စာသားသမိုင်းကြောင်း (n-gram history) အကြား ဆက်နွှယ်မှုကို ဂုဏ်သတ္တိလုပ်ဆောင်ချက် (feature functions) များအသုံးပြု၍ သင်္ချာနည်းအရ ပြောင်းလဲသတ်မှတ်ပေးသည်။ ၎င်းအတွက် သင်္ချာညီမျှခြင်းမှာ အောက်ပါအတိုင်း ဖြစ်သည်။

ဤညီမျှခြင်းတွင် -

  • သည် ပိုင်းခြေခွဲလုပ်ဆောင်ချက် (partition function) ဖြစ်သည်။
  • သည် ပါရာမီတာဗက်တာ (parameter vector) ဖြစ်သည်။
  • သည် ဂုဏ်သတ္တိလုပ်ဆောင်ချက် (feature function) ဖြစ်သည်။

အရှင်းဆုံးအခြေအနေတွင် ဤဂုဏ်သတ္တိလုပ်ဆောင်ချက်သည် သတ်မှတ်ထားသောn-gram တစ်ခု ရှိနေခြင်း သို့မဟုတ် မရှိနေခြင်းကို ပြသသည့် ညွှန်းကိန်းတစ်ခုမျှသာ ဖြစ်သည်။ ပါရာမီတာဗက်တာ ပေါ်တွင် ကနဦးယူဆချက် (prior) တစ်ခု သို့မဟုတ် ပုံသေနည်းမှန်ကန်အောင် ထိန်းညှိခြင်းပုံစံ (regularization) တစ်ခုခုကို အသုံးပြုခြင်းက မော်ဒယ်အတွက် ပိုမိုအထောက်အကူပြုစေသည်။

Log-bilinear မော်ဒယ် သည်လည်း အညွှန်းကိန်းအခြေပြု ဘာသာစကားမော်ဒယ် (exponential language model) ၏ အခြားဥပမာတစ်ခု ဖြစ်သည်။

Skip-gram မော်ဒယ်

[ပြင်ဆင်ရန်]

Skip-gram မော်ဒယ်သည် စကားလုံးများ၏ အဓိပ္ပာယ်ကို ကိန်းဂဏန်းဗက်တာများအဖြစ် ပြောင်းလဲပေးသည့် Word2Vec နည်းပညာ၏ အခြေခံဗျူဟာတစ်ခု ဖြစ်သည်။ ဤမော်ဒယ်သည် ပေးထားသော ပစ်မှတ်စကားလုံး (target word) တစ်လုံးကို အခြေခံ၍ ၎င်း၏ ရှေ့နှင့်နောက်တွင် ရှိနေနိုင်မည့် ပတ်ဝန်းကျင်စကားလုံး (context words) များကို ကြိုတင်ခန့်မှန်းပေးသည့် စနစ်ဖြင့် အလုပ်လုပ်သည်။ သာမန် n-gram မော်ဒယ်များကဲ့သို့ ကပ်လျက်စကားလုံးများကိုသာ ကြည့်ခြင်းမဟုတ်ဘဲ ကြားထဲရှိ စကားလုံးအချို့ကို ကျော်လွှား (skip) ၍ ဆက်စပ်တွက်ချက်နိုင်ခြင်းကြောင့် စာသားတစ်ခုအတွင်းရှိ စကားလုံးများ၏ ရေရှည်ဆက်နွှယ်မှုနှင့် ဆန္ဒာနုရူပ အဓိပ္ပာယ်များကို ပိုမိုထိရောက်စွာ ဖမ်းဆုပ်နိုင်စွမ်း ရှိသည်။

နျူရယ်မော်ဒယ်များ

[ပြင်ဆင်ရန်]

Recurrent neural network

[ပြင်ဆင်ရန်]

ပညာရှင်များသည် recurrent neural network ကို အခြေခံထားသော ဘာသာစကားမော်ဒယ်များ (၎င်းတို့ကို သုံးဖက်မြင်အာကာသသုံး ဘာသာစကားမော်ဒယ်များ - continuous space language models ဟုလည်း ခေါ်ဆို) တွင် စကားလုံးများကို ကိန်းဂဏန်းများဖြင့် စဉ်ဆက်မပြတ် ဖော်ပြပေးသည့် စနစ် (continuous representations သို့မဟုတ် embeddings) ကို ဖန်တီးအသုံးပြုကြသည်။[၁၄] ထိုသို့ စဉ်ဆက်မပြတ် ဖော်ပြပေးနိုင်ခြင်းက ဒေတာများ အလွန်အမင်း ထပ်တိုးလာသည့် ပြဿနာ (curse of dimensionality) ကို လျှော့ချပေးနိုင်သည်။ ၎င်းပြဿနာသည် ဝေါဟာရပမာဏ တိုးပွားလာသည်နှင့်အမျှ ဖြစ်နိုင်ခြေရှိသော စကားလုံးအစီအစဉ် အရေအတွက်က အဆမတန် မြင့်တက်လာပြီး ဒေတာများ လုံလောက်မှုမရှိခြင်း (data sparsity problem) ကို ဖြစ်ပေါ်စေခြင်း ဖြစ်သည်။ နျူရယ်ကွန်ရက် (သို့မဟုတ်) အာရုံကြောပုံတူ ကွန်ရက် (Neural networks) များသည် စကားလုံးများကို ကွန်ရက်အတွင်းရှိ အလေးသာချက်တန်ဖိုးများ (weights) ၏ ရိုးရှင်းမဟုတ်သော မျဉ်းကွေး ဆက်နွှယ်မှုများ (non-linear combinations) ဖြင့် ဖော်ပြပေးခြင်းအားဖြင့် ဤပြဿနာကို ကျော်လွှားနိုင်ခဲ့ကြသည်။[၁၅]

အဆင့်မြင့် ဘာသာစကားမော်ဒယ်ကြီးများ (LLMs)

[ပြင်ဆင်ရန်]

လက်ရှိခေတ်သစ်တွင် ဘာသာစကားမော်ဒယ်များ၏ အဆင့်မြင့်ဆုံးပုံစံမှာ အဆင့်မြင့် ဘာသာစကားမော်ဒယ်ကြီးများ (LLMs) ဖြစ်သည်။ ဤမော်ဒယ်များသည် အချက်အလက်များ၏ အဓိပ္ပာယ်နှင့် ဆက်စပ်မှုကို ပိုမိုနက်ရှိုင်းစွာ နားလည်နိုင်ရန်အတွက် transformer တည်ဆောက်ပုံစနစ်ကို အဓိက အသုံးပြုထားသည်။ ပညာရှင်များသည် ၎င်းတို့ကို အင်တာနက် စာမျက်နှာများ၊ စာအုပ်များနှင့် သုတေသနစာတမ်းများမှ ရယူထားသော ဘီလီယံနှင့်ချီသည့် တိုကင် (token) အမြောက်အမြားဖြင့် လေ့ကျင့်သင်ကြားပေးထားသည်။ ဤမော်ဒယ်ကြီးများသည် စာသားများကို သာမန်ခန့်မှန်းပေးရုံရုံမျှမကဘဲ လူသားများကဲ့သို့ ကျိုးကြောင်းဆင်ခြင်ခြင်း၊ ကုဒ်ရေးသားခြင်း၊ စာအနှစ်ချုပ်ခြင်းနှင့် မေးခွန်းများကို တိကျစွာ တုံ့ပြန်ဖြေကြားခြင်း စသည့် ရှုပ်ထွေးသော လုပ်ငန်းစဉ်များကိုပါ စွမ်းဆောင်နိုင်ကြသည်။


ဤမော်ဒယ်များသည် အချို့သော လုပ်ငန်းဆောင်တာများတွင် လူသားတို့၏ စွမ်းဆောင်ရည်နှင့် တူညီမှုရှိသော်လည်း၊ လူသားတို့၏ သိမှုဗေဒဆိုင်ရာ နမူနာပုံစံများ (cognitive models) ဖြစ်နိုင်ခြေ ရှိမရှိကိုမူ တိကျစွာ မသိရသေးပါ။ အနည်းဆုံးအားဖြင့် recurrent neural networks များသည် လူသားတို့ သတိမပြုမိသော ပုံစံများကို တစ်ခါတစ်ရံ သင်ယူနိုင်သော်လည်း၊ လူသားတို့ ပုံမှန်နားလည်လွယ်သည့် အခြေခံပုံစံများကိုမူ သင်ယူရန် ပျက်ကွက်တတ်ကြောင်း သုတေသနများက ပြသနေသည်။[၁၆]

စွမ်းဆောင်ရည် စစ်ဆေးခြင်းနှင့် စံနှုန်းသတ်မှတ်ချက်များ

[ပြင်ဆင်ရန်]

ပညာရှင်များသည် ဘာသာစကားမော်ဒယ်များ၏ အရည်အသွေးကို စစ်ဆေးရာတွင် ပုံမှန်ဘာသာစကားအခြေပြု လုပ်ငန်းစဉ်များမှတစ်ဆင့် လူသားတို့ကိုယ်တိုင် ဖန်တီးထားသော စံပြစစ်ဆေးချက်များ (sample benchmarks) နှင့် နှိုင်းယှဉ်၍ အဓိက လုပ်ဆောင်ကြသည်။ အခြားသော အသုံးနည်းသေးသည့် အရည်အသွေးစစ်ဆေးမှုများတွင်မူ ဘာသာစကားမော်ဒယ်တစ်ခု၏ ပင်ကိုဝိသေသလက္ခဏာများကို စမ်းသပ်ခြင်း သို့မဟုတ် ထိုကဲ့သို့သော မော်ဒယ်နှစ်ခုကို အချင်းချင်း တိုက်ရိုက်နှိုင်းယှဉ်ခြင်းများ ပြုလုပ်ကြသည်။ ဘာသာစကားမော်ဒယ်များကို အချက်အလက်များထံမှ စဉ်ဆက်မပြတ် သင်ယူနိုင်စွမ်းရှိသော ပြောင်းလဲလဲလှယ်နိုင်သည့် စနစ်များအဖြစ် ရည်ရွယ်တည်ဆောက်ထားသောကြောင့်၊ အချို့သော မော်ဒယ်အသစ်များတွင် သင်ယူမှုမျဉ်းကွေးများ (learning curves) ကို ဆန်းစစ်ခြင်းအားဖြင့် ၎င်းတို့၏ သင်ယူမှုအရှိန်အဟုန်ကိုပါ ထည့်သွင်းစစ်ဆေးကြသည်။[၁၇]

ဘာသာစကားစီမံဆောင်ရွက်မှု စနစ်များကို စစ်ဆေးအကဲဖြတ်ရန်အတွက် မတူညီသော ဒေတာစုအမျိုးမျိုးကို တီထွင်ဖန်တီးထားကြသည်။[၁၈] ၎င်းတို့တွင် အောက်ပါစံနှုန်းများ ပါဝင်သည် -

  • MMLU (Massive Multitask Language Understanding)[၁၉]
  • CoLA (Corpus of Linguistic Acceptability) - ဘာသာစကားဆိုင်ရာ လက်ခံနိုင်မှုအဆင့် စာစုအချက်အလက်[၂၀]
  • GLUE benchmark - အထွေထွေ ဘာသာစကားနားလည်မှု စံနှုန်း[၂၁]
  • MRPC (Microsoft Research Paraphrase Corpus) - မိုက်ခရိုဆော့ဖ် သုတေသနအဖွဲ့၏ အဓိပ္ပာယ်တူ ဝါကျပြောင်းလဲမှု စာစုအချက်အလက်[၂၂]
  • MNLI (Multi-Genre Natural Language Inference) - ကဏ္ဍစုံ သဘာဝဘာသာစကား ကျိုးကြောင်းကောက်ချက်ချမှုစနစ်[၂၃]
  • QNLI (Question Natural Language Inference) - မေးခွန်းအခြေပြု သဘာဝဘာသာစကား ကျိုးကြောင်းကောက်ချက်ချမှုစနစ်
  • QQP (Quora Question Pairs) - Quora ဝက်ဘ်ဆိုက်မှ မေးခွန်းတူအစုံများ[၂၄]
  • RTE (Recognizing Textual Entailment) - စာသားချင်း အဓိပ္ပာယ်သက်ရောက်မှု ခွဲခြားခြင်းစနစ်[၂၅]
  • STS-B (Semantic Textual Similarity Benchmark) - စာသားချင်း အဓိပ္ပာယ်တူညီမှု စံနှုန်း
  • SQuAD (Stanford Question Answering Dataset) - စတန်းဖို့ဒ် မေးခွန်းနှင့် အဖြေ စစ်ဆေးချက်ဒေတာစု[၂၆]
  • SST (Stanford Sentiment Treebank) - စတန်းဖို့ဒ် ခံစားချက်ဆန်းစစ်မှုစနစ်[၂၇]
  • WNLI (Winograd NLI) - ဝီနိုဂရတ် သဘာဝဘာသာစကား ကျိုးကြောင်းကောက်ချက်ချမှုစနစ်
  • အခြားစစ်ဆေးချက်များ: BoolQ၊ PIQA၊ SIQA၊ HellaSwag၊ WinoGrande၊ ARC၊ OpenBookQA၊ NaturalQuestions၊ TriviaQA၊ RACE၊ BIG-bench hard၊ GSM8k (သင်္ချာပုစ္ဆာ)၊ RealToxicityPrompts (အဆိပ်အတောက်ဖြစ်စေမည့်စာသား စစ်ဆေးချက်)၊ WinoGender နှင့် CrowS-Pairs (ခွဲခြားဆက်ဆံမှုစစ်ဆေးချက်များ)။[၂၈]

ကိုးကားချက်များ

[ပြင်ဆင်ရန်]
  1. "What are large language models supposed to model?" (November 2023). Trends in Cognitive Sciences 27 (11): 987–989. doi:10.1016/j.tics.2023.08.006. PMID 37659920."LLMs are supposed to model how utterances behave."
  2. Jurafsky၊ Dan; Martin၊ James H. (2021)။ "N-gram Language Models" (PDF)Speech and Language Processing (3rd ed.)။ 22 May 2022 တွင် မူရင်းမှ မော်ကွန်းတင်ပြီး 24 May 2022 တွင် ပြန်စစ်ပြီး
  3. "A cache-based natural language model for speech recognition" (1990). IEEE Transactions on Pattern Analysis and Machine Intelligence 12 (6): 570–583. doi:10.1109/34.56193. Bibcode: 1990ITPAM..12..570K.
  4. Andreas, Jacob, Andreas Vlachos, and Stephen Clark (2013). "Semantic parsing as machine translation" 15 August 2020 ၌ မော်ကွန်းပြန်ကြည့်စက်တွင် မော်ကွန်းတင်ပြီး .. Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers).
  5. "Can language models be used for real-world urban-delivery route optimization?" (2023). The Innovation 4 (6). doi:10.1016/j.xinn.2023.100520. PMID 37869471. Bibcode: 2023Innov...400520L.
  6. Pham၊ Vu; Bluche၊ Théodore; Kermorvant၊ Christopher; Louradour၊ Jérôme (2013)။ "Dropout improves Recurrent Neural Networks for Handwriting Recognition"။ arXiv:1312.4569 [cs.CV]။
  7. Phu Mon Htut; Cho၊ Kyunghyun; Bowman၊ Samuel R. (2018)။ "Grammar Induction with Neural Language Models: An Unusual Replication"။ arXiv:1808.10000 [cs.CL]။
  8. Ponte၊ Jay M.; Croft၊ W. Bruce (1998)။ A language modeling approach to information retrieval။ Proceedings of the 21st ACM SIGIR Conference။ Melbourne, Australia: ACM။ pp. 275–281။ doi:10.1145/290941.291008
  9. Ponte၊ Jay M.; Croft၊ W. Bruce (1998)။ A language modeling approach to information retrieval။ Proceedings of the 21st ACM SIGIR Conference။ Melbourne, Australia: ACM။ pp. 275–281။ doi:10.1145/290941.291008
  10. Maity၊ Abhishek (March 2026)။ "CrisisSense: Transforming Social Signals into Real-Time Disaster Awareness via Deep Neural Intelligence"။ 2026 IEEE Madhya Pradesh Section Conference (MPCON)။ pp. 1501–1506။ doi:10.1109/MPCON69668.2026.11508516ISBN 979-8-3315-9335-3
  11. Chomsky, N. (September 1956). "Three models for the description of language". IRE Transactions on Information Theory 2 (3): 113–124. doi:10.1109/TIT.1956.1056813. ISSN 2168-2712. Bibcode: 1956IRTIT...2..113C.
  12. "The Nature Of Life, The Nature Of Thinking: Looking Back On Eugene Charniak's Work And Life" (in en)၊ 2022-02-22။
  13. "Two decades of statistical language modeling: Where do we go from here?" (2000). Proceedings of the IEEE 88 (8): 1270–1278. doi:10.1109/5.880083. Bibcode: 2000IEEEP..88.1270R.
  14. The Unreasonable Effectiveness of Recurrent Neural Networks 1 November 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 27 January 2019 တွင် ပြန်စစ်ပြီး။
  15. Bengio၊ Yoshua (2008)။ "Neural net language models"Scholarpedia3။ p. 3881။ Bibcode:2008SchpJ...3.3881Bdoi:10.4249/scholarpedia.3881။ 26 October 2020 တွင် မူရင်းမှ မော်ကွန်းတင်ပြီး 28 August 2015 တွင် ပြန်စစ်ပြီး
  16. Hornstein၊ Norbert; Lasnik၊ Howard; Patel-Grosz၊ Pritty; Yang၊ Charles (2018-01-09)။ Syntactic Structures after 60 Years: The Impact of the Chomskyan Revolution in Linguistics (အင်္ဂလိပ်ဘာသာစကားဖြင့်)။ Walter de Gruyter GmbH & Co KG။ ISBN 978-1-5015-0692-5။ 16 April 2023 တွင် မူရင်းမှ မော်ကွန်းတင်ပြီး 11 December 2021 တွင် ပြန်စစ်ပြီး
  17. Karlgren၊ Jussi; Schutze၊ Hinrich (2015)၊ "Evaluating Learning Language Representations"၊ International Conference of the Cross-Language Evaluation Forum၊ Lecture Notes in Computer Science၊ Springer International Publishing၊ pp. 254–260၊ doi:10.1007/978-3-319-64206-2_8ISBN 978-3-319-64205-5
  18. Devlin၊ Jacob; Chang၊ Ming-Wei; Lee၊ Kenton; Toutanova၊ Kristina (2018-10-10)။ "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding"။ arXiv:1810.04805 [cs.CL]။
  19. Hendrycks၊ Dan (2023-03-14)၊ Measuring Massive Multitask Language Understanding၊ 15 March 2023 တွင် မူရင်းမှ မော်ကွန်းတင်ပြီး 2023-03-15 တွင် ပြန်စစ်ပြီး
  20. The Corpus of Linguistic Acceptability (CoLA) 7 December 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  21. GLUE Benchmark (in en)။ 4 November 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  22. Microsoft Research Paraphrase Corpus (in en-us)။ 25 October 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  23. Microsoft Research Paraphrase Corpus (in en-us)။ 25 October 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  24. Aghaebrahimian၊ Ahmad (2017)၊ "Quora Question Answer Dataset"၊ Text, Speech, and Dialogue၊ Lecture Notes in Computer Science၊ 10415၊ Springer International Publishing၊ pp. 66–73၊ doi:10.1007/978-3-319-64206-2_8ISBN 978-3-319-64205-5
  25. Recognizing Textual Entailment 9 August 2017 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ February 24, 2019 တွင် ပြန်စစ်ပြီး။
  26. The Stanford Question Answering Dataset 30 October 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  27. Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank 27 October 2020 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2019-02-25 တွင် ပြန်စစ်ပြီး။
  28. llama/MODEL_CARD.md at main · meta-llama/llama (in en)။ 2024-12-28 တွင် ပြန်စစ်ပြီး။