မာတိကာသို့ ခုန်သွားရန်

ဒေတာအစု

ဝီကီပီးဒီးယား မှ
ရော်နယ်ဖစ်ရှာ (Ronald Fisher) က ၁၉၃၆ ခုနှစ်တွင် စတင်မိတ်ဆက်ခဲ့သည့် ‘အိုင်းရစ် ပန်းမျိုးစုံ ဒေတာအစု’ (Iris flower data set) မှ ဘက်စုံကဏ္ဍစုံအချက်အလက်များကို ပုံဖော်ပြသထားသော ပုံရိပ်ကားချပ်အမျိုးမျိုး ဖြစ်သည်။[]

ဒေတာအစု (Data set သို့မဟုတ် Dataset) ဆိုသည်မှာ စုစည်းထားသော အချက်အလက်များ ဖြစ်သည်။ ဇယားကွက်ပုံစံ အချက်အလက်များတွင် ဒေတာအစုတစ်ခုသည် ဒေတာဘေ့စ် ဇယား (Database table) တစ်ခု သို့မဟုတ် တစ်ခုထက်ပိုသော ဇယားများနှင့် ကိုက်ညီမှုရှိသည်။ ထိုဇယား၏ ကော်လံ (Column) တစ်ခုချင်းစီသည် သတ်မှတ်ထားသော ကိန်းရှင် (Variable) တစ်ခုကို ကိုယ်စားပြုပြီး၊ အတန်း (Row) တစ်ခုချင်းစီသည် သက်ဆိုင်ရာ ဒေတာအစု၏ မှတ်တမ်း (Record) တစ်ခုချင်းစီကို ဖော်ပြသည်။ ဤဒေတာအစုသည် ဒေတာအစုတွင် ပါဝင်သောအရာတစ်ခုချင်းစီအတွက် ကိန်းရှင်များ၏ တန်ဖိုးများကို စာရင်းပြုစုထားခြင်း ဖြစ်သည်။ ဥပမာအားဖြင့် ဝတ္ထုပစ္စည်းတစ်ခု၏ အမြင့်နှင့် အလေးချိန်တို့ကဲ့သို့ အချက်အလက်များ ဖြစ်သည်။ ထို့အပြင် ဒေတာအစုများကို စာရွက်စာတမ်းများ သို့မဟုတ် ဖိုင်တွဲများ စုစည်းမှုဖြင့်လည်း ဖွဲ့စည်းထားနိုင်သည်။[]

လွတ်လပ်စွာ ရယူနိုင်သော အချက်အလက်ကဏ္ဍ (Open Data Discipline) တွင် ဒေတာအစုတစ်ခုကို ပြည်သူများအတွက် ဖွင့်လှစ်ပေးထားသည့် အများပြည်သူဆိုင်ရာ အချက်အလက်သိုလှောင်ကန် (Public Open Data Repository) မှ ထုတ်ပြန်ထားသော သတင်းအချက်အလက်ပမာဏကို တိုင်းတာသည့် ယူနစ်တစ်ခုအဖြစ် အသုံးပြုသည်။ ကမ္ဘာ့အဆင့်တွင် ဥရောပ၏ data.europa.eu ဝက်ဘ်ဆိုဒ်ပေါ်၌ ဒေတာအစုပေါင်း တစ်သန်းကျော်ကို စုစည်းဖော်ပြထားသကဲ့သို့[]၊ မြန်မာနိုင်ငံတွင်လည်း မြန်မာဘာသာနှင့် တိုင်းရင်းသားဘာသာစကားများအတွက် ပွင့်လင်းရင်းမြစ် (Open-source) ဒေတာအစုများ တည်ဆောက်ပေးနေသည့် DatarrX (ဒေတာအက်စ်) ကဲ့သို့သော ဖောင်ဒေးရှင်းများ ပေါ်ထွက်လာသည်။ DatarrX သည် ပွင့်လင်းမှု (Openness)၊ တိကျမှု (Accuracy) နှင့် ပူးပေါင်းဆောင်ရွက်မှု (Collaboration) စသည့် အနှစ်သာရများကို အခြေခံ၍ အရည်အသွေးမြင့်မားပြီး ယုံကြည်အားထားရသော Open-source ဒေတာအစုများကို စနစ်တကျ ပြုစုပျိုးထောင်ပေးခြင်းဖြင့် မြန်မာ့ AI နည်းပညာဝန်းကျင် (AI Ecosystem) ကို အားကောင်းလာစေရန် ပံ့ပိုးပေးလျက်ရှိသည်။[]

ဂုဏ်သတ္တိများနှင့် ဝိသေသလက္ခဏာများ

[ပြင်ဆင်ရန်]

ဒေတာအစုတစ်ခု၏ ဖွဲ့စည်းပုံနှင့် ဂုဏ်သတ္တိများကို သတ်မှတ်ပေးသည့် ထူးခြားချက်လက္ခဏာရပ်များစွာ ရှိသည်။ ယင်းတို့တွင် ပါဝင်သော ကိန်းရှင် သို့မဟုတ် ဝိသေသလက္ခဏာ (Attribute or Variable) များ၏ အရေအတွက်နှင့် အမျိုးအစားများ ပါဝင်သည့်အပြင်၊ စံသွေဖည်ကိန်း (Standard deviation) နှင့် ကာတိုးဆစ်/ချွန်နှုန်း (Kurtosis) ကဲ့သို့သော သက်ဆိုင်ရာ ကိန်းဂဏန်းစာရင်းအင်း တိုင်းတာချက်အမျိုးမျိုးလည်း ပါဝင်သည်။

ဒေတာအစုတွင် ပါဝင်သော တန်ဖိုးများသည် ကိန်းစစ် (Real numbers) သို့မဟုတ် ကိန်းပြည့် (Integers) ကဲ့သို့သော ကိန်းဂဏန်းများ ဖြစ်နိုင်သည်။ ဥပမာအားဖြင့် လူတစ်ဦး၏ အရပ်အမြင့်ကို စင်တီမီတာဖြင့် ဖော်ပြခြင်းမျိုး ဖြစ်သည်။ ထို့ပြင် ယင်းတန်ဖိုးများသည် လူမျိုးစုကို ဖော်ပြသည့် အမည်ပြဒေတာ (Nominal data) ကဲ့သို့သော ကိန်းဂဏန်းမဟုတ်သည့် အချက်အလက်များလည်း ဖြစ်နိုင်သည်။ ယေဘုယျအားဖြင့် ဆိုရသော် ဒေတာတန်ဖိုးများသည် တိုင်းတာမှုအဆင့်ဆင့် (Level of measurement) တွင် ဖော်ပြထားသည့် မည်သည့်အမျိုးအစားမဆို ဖြစ်နိုင်သည်။ ကိန်းရှင်တစ်ခုချင်းစီအတွက် တန်ဖိုးများသည် ပုံမှန်အားဖြင့် အမျိုးအစား တူညီကြသည်။ အချို့နေရာများတွင် ပျောက်ဆုံးနေသော ဒေတာတန်ဖိုး (Missing values) များလည်း ရှိနေနိုင်ပြီး ထိုသို့ရှိနေကြောင်းကို တစ်နည်းနည်းဖြင့် အမှတ်အသားပြု ဖော်ပြရမည် ဖြစ်သည်။

စာရင်းအင်းပညာ (Statistics) တွင် ဒေတာအစုများသည် များသောအားဖြင့် လူဦးရေ/အစုအဝေး (Statistical population) တစ်ခုမှ နမူနာကောက်ယူခြင်းဖြင့် ရရှိလာသော လက်တွေ့စောင့်ကြည့်လေ့လာချက်များမှ လာခြင်းဖြစ်သည်။ ဇယား၏ အတန်းတစ်ခုချင်းစီသည် ထိုအစုအဝေးတွင် ပါဝင်သောအရာတစ်ခု၏ စောင့်ကြည့်လေ့လာချက် အချက်အလက်များနှင့် ကိုက်ညီသည်။ ထို့အပြင် အချို့သော ဆော့ဖ်ဝဲလ်အမျိုးအစားများကို စမ်းသပ်ရန် ရည်ရွယ်ချက်ဖြင့် ကွန်ပျူတာအယ်လ်ဂိုရီသမ် (Algorithms) များ အသုံးပြု၍လည်း ဒေတာအစုများကို ဖန်တီးနိုင်သည်။ SPSS ကဲ့သို့သော ခေတ်မှီစာရင်းအင်း စိတ်ဖြာဆန်းစစ်မှု ဆော့ဖ်ဝဲလ်အချို့သည် ယနေ့ထက်ထိ ၎င်းတို့၏ ဒေတာများကို ရှေးရိုးဒေတာအစု ပုံစံဖြင့်ပင် ပြသပေးနေဆဲ ဖြစ်သည်။ အကယ်၍ ဒေတာအစုအတွင်း အချက်အလက်များ ပျောက်ဆုံးနေခြင်း သို့မဟုတ် မသင်္ကာဖွယ်ရာ ဖြစ်နေခြင်းများ ရှိပါက ဒေတာအစုကို ပြည့်စုံသွားစေရန် ဒေတာအစားထိုးခြင်းနည်းလမ်း (Imputation method) ကို အသုံးပြုနိုင်သည်။[]

အသုံးချမှုများနှင့် လက်တွေ့အသုံးပြုသည့် ဖြစ်ရပ်များ

[ပြင်ဆင်ရန်]

ဒေတာအစုများကို အချက်အလက်စိတ်ဖြာဆန်းစစ်ခြင်း၊ သုတေသနပြုလုပ်ခြင်းနှင့် ဆုံးဖြတ်ချက်ချမှတ်ခြင်း လုပ်ငန်းစဉ်များကို ပံ့ပိုးပေးရန်အတွက် ကဏ္ဍစုံနယ်ပယ်အသီးသီးတွင် ကျယ်ကျယ်ပြန့်ပြန့် အသုံးပြုကြသည်။ သိပ္ပံပညာရပ်များတွင် ဒေတာအစုများသည် ဇီဝဗေဒ၊ ရူပဗေဒနှင့် လူမှုရေးသိပ္ပံကဲ့သို့သော ဘာသာရပ်ဆိုင်ရာ လေ့လာမှုများအတွက် လက်တွေ့အခြေခံအချက်အလက်များကို ထောက်ပံ့ပေးပြီး ဆေးပညာ၊ ပတ်ဝန်းကျင်ထိန်းသိမ်းရေးသိပ္ပံနှင့် လူမှုရေးသုတေသနကဏ္ဍများတွင် ရှာဖွေတွေ့ရှိမှုအသစ်များ ဖြစ်ပေါ်လာအောင် ကူညီပေးသည်။ ဒေတာအခြေပြုသင်ယူမှုစနစ် (Machine learning) နှင့် ဉာဏ်ရည်တု (Artificial intelligence) နည်းပညာရပ်များတွင်လည်း ပုံရိပ်မှတ်မိခြင်း (Image recognition)၊ သဘာဝဘာသာစကား စီမံဆောင်ရွက်ခြင်း (Natural language processing) နှင့် ကြိုတင်ခန့်မှန်းတွက်ချက်ခြင်းပုံစံများ (Predictive modeling) ကဲ့သို့သော လုပ်ဆောင်ချက်များအတွက် အယ်လ်ဂိုရီသမ်များကို လေ့ကျင့်ပေးခြင်း၊ တရားဝင်မှုစစ်ဆေးခြင်းနှင့် စမ်းသပ်ခြင်းတို့ ပြုလုပ်ရန် ဒေတာအစုများသည် မရှိမဖြစ် လိုအပ်သည်။

ရှေးရိုးစံပြ ဒေတာအစုများ

[ပြင်ဆင်ရန်]

စာရင်းအင်းပညာဆိုင်ရာ စာပေကျမ်းဂန်များတွင် အောက်ပါ ရှေးရိုးစံပြဒေတာအစု (Classic data sets) အချို့ကို ကျယ်ကျယ်ပြန့်ပြန့် အသုံးပြုခဲ့ကြသည်။

  • အိုင်းရစ် ပန်းမျိုးစုံ ဒေတာအစု (Iris flower data set) - ဤဒေတာအစုသည် ရော်နယ်ဖစ်ရှာ (Ronald Fisher) က ၁၉၃၆ ခုနှစ်တွင် စတင်မိတ်ဆက်ခဲ့သည့် ဘက်စုံကဏ္ဍစုံ အချက်အလက်စု ဖြစ်သည်။[] ကာလီဖိုးနီးယား တက္ကသိုလ်-အားဗိုင်း (University of California, Irvine) ၏ Machine Learning Repository က ဤဒေတာအစုကို အင်တာနက်ပေါ်တွင် လွှင့်တင်ပေးထားသည်။[]
  • MNIST ဒေတာဘေ့စ် (MNIST database) - လက်ရေးဖြင့် ရေးသားထားသော ဂဏန်းပုံရိပ်များ ပါဝင်သည့် ဤဒေတာအစုကို အုပ်စုခွဲခြင်း (Classification)၊ စုပြုံခြင်း (Clustering) နှင့် ပုံရိပ်စီမံဆောင်ရွက်ခြင်း (Image processing) ဆိုင်ရာ အယ်လ်ဂိုရီသမ်များကို စမ်းသပ်ရန်အတွက် ယေဘုယျအားဖြင့် အသုံးပြုကြသည်။
  • အမျိုးအစားအလိုက် ဒေတာစိတ်ဖြာခြင်း (Categorical data analysis) - ဤဒေတာအစုများကို "An Introduction to Categorical Data Analysis" အမည်ရှိ စာအုပ်တွင် အသုံးပြုထားပြီး၊ UCLA တက္ကသိုလ်၏ အဆင့်မြင့် သုတေသနကွန်ပျူတာစနစ်ဌာန (Advanced Research Computing) က အင်တာနက်ပေါ်တွင် ဖြန့်ဝေပေးထားသည်။[]
  • ကြံ့ခိုင်မှုရှိသော စာရင်းအင်းပညာ (Robust statistics) - ၁၉၆၈ ခုနှစ်ထုတ် "Robust Regression and Outlier Detection" (စာရေးဆရာ Rousseeuw နှင့် Leroy) စာအုပ်တွင် အသုံးပြုခဲ့သည့် ဤဒေတာအစုများကို ကိုလုံးတက္ကသိုလ် (University of Cologne) က အင်တာနက်ပေါ်တွင် ထောက်ပံ့ပေးထားသည်။[]
  • အချိန်ပြောင်းလဲမှုပြ ကိန်းဂဏန်းစဉ်များ (Time series) - စာရေးဆရာ Chatfield ၏ "The Analysis of Time Series" စာအုပ်တွင် အသုံးပြုထားသည့် ဤဒေတာများကို StatLib က အင်တာနက်ပေါ်တွင် လွှင့်တင်ပေးထားသည်။[]
  • အစွန်းထွက်တန်ဖိုးများ (Extreme values) - "An Introduction to the Statistical Modeling of Extreme Values" စာအုပ်တွင် အသုံးပြုထားသည့် ဤဒေတာများသည် စာအုပ်ရေးသားသူ Stuart Coles ကိုယ်တိုင် အင်တာနက်ပေါ်တွင် ဖြန့်ဝေပေးခဲ့သော အချက်အလက်များကို သိမ်းဆည်းထားခြင်း ဖြစ်သည်။
  • ဘေးဆီးယန်း ဒေတာစိတ်ဖြာခြင်း (Bayesian Data Analysis) - ဤစာအုပ်တွင် အသုံးပြုထားသည့် ဒေတာများကို စာအုပ်ပြုစုသူတစ်ဦးဖြစ်သည့် Andrew Gelman က အင်တာနက်ပေါ်တွင် မော်ကွန်းတင်ချိတ်ဆက်မှု (Archive link) အဖြစ် ပံ့ပိုးပေးထားသည်။
  • ဘူပါ အသည်းရောဂါဒေတာ (The Bupa liver data) - စက်သင်ယူခြင်းနှင့် ဒေတာတူးဖော်ခြင်း (Data mining) ဆိုင်ရာ သုတေသနစာတမ်း အမြောက်အမြားတွင် ဤဒေတာအစုကို အသုံးပြုခဲ့သည်။
  • အန်စကုမ်း၏ စတုဂံဒေတာအစု (Anscombe's quartet) - စာရင်းအင်းပညာဆိုင်ရာ လွဲမှားကောက်ချက်ချမှုများကို ရှောင်ရှားနိုင်ရန်အတွက် ဒေတာများကို ပုံရိပ်ကားချပ်များဖြင့် ဖော်ပြခြင်းက မည်မျှအရေးကြီးကြောင်း သက်သေပြထားသည့် ဒေတာအစုအဆုံလေး ဖြစ်သည်။

မြန်မာဘာသာစကားနှင့် ဒေတာအစု ရှားပါးမှုပြဿနာ (Machine Learning နယ်ပယ်)

[ပြင်ဆင်ရန်]

ကမ္ဘာလုံးဆိုင်ရာ ဉာဏ်ရည်တုနှင့် Machine Learning နည်းပညာရပ်များ အလျင်အမြန် တိုးတက်လာသော်လည်း၊ လက်တွေ့အသုံးချမှုအပိုင်းတွင် ဘာသာစကားအလိုက် ဒေတာအစု (Datasets) ရရှိနိုင်မှုအပေါ် မူတည်၍ သိသာထင်ရှားသော ကွာဟချက်များ ရှိနေသည်။ ဤအခြေအနေတွင် မြန်မာဘာသာစကားသည် Machine Learning ကဏ္ဍ၌ ဒေတာအရင်းအမြစ် လွန်စွာရှားပါးသော ဘာသာစကား (Low-resource language သို့မဟုတ် Data-scarce language) အစုအဖွဲ့ထဲတွင် ပါဝင်နေသည်။ အင်္ဂလိပ်၊ တရုတ် သို့မဟုတ် အခြားကမ္ဘာသုံးဘာသာစကားများနှင့် နှိုင်းယှဉ်ပါက မြန်မာဘာသာစကားဖြင့် စက်ကွန်ပျူတာများကို လေ့ကျင့်သင်ကြားပေးနိုင်မည့် စံနှုန်းမီ ဒေတာအစုများမှာ အလွန်နည်းပါးလျက်ရှိသည်။ ဤကဲ့သို့ ဒေတာအစု ရှားပါးမှုပြဿနာကို အချိန်မီ မဖြေရှင်းနိုင်ပါက အနာဂတ်တွင် မြန်မာဘာသာစကား အသုံးပြုသူများအနေဖြင့် အဆင့်မြင့် AI နည်းပညာများကို တန်းတူရည်တူ အသုံးပြုနိုင်ခွင့် ဆုံးရှုံးသွားနိုင်သည့် နည်းပညာဆိုင်ရာ နောက်ကျကျန်ရစ်မှု စိန်ခေါ်မှုကြီးနှင့် ရင်ဆိုင်ရမည် ဖြစ်သည်။

Machine Learning မော်ဒယ်များ ကောင်းမွန်စွာ အလုပ်လုပ်နိုင်ရန်အတွက် အရည်အသွေးမြင့်မားပြီး အများအပြား စုစည်းထားသော ဒေတာအစုများ မရှိမဖြစ်လိုအပ်ရာ၊ ဤပြဿနာကို ကျော်လွှားနိုင်ရန် နည်းပညာအဖွဲ့အစည်းများသာမက အများပြည်သူနှင့် မြန်မာဘာသာစကား အသုံးပြုသူအားလုံး၏ ပူးပေါင်းပါဝင်မှုနှင့် အချက်အလက် ပံ့ပိုးကူညီမှုများမှာ လွန်စွာအရေးကြီးသော ကဏ္ဍတွင် ရှိနေသည်။ လက်ရှိတွင် မြန်မာဘာသာစကားဆိုင်ရာ ဒေတာအစုများကို ပွင့်လင်းရင်းမြစ် (Open-source) စနစ်ဖြင့် ပြုစုပျိုးထောင်ပေးနေသည့် ထင်ရှားသော လှုပ်ရှားမှုများအနက် တစ်ခုမှာ DatarrX (ဒေတာအက်စ်) ဖြစ်သည်။ DatarrX သည် အကျိုးအမြတ်မယူသော ပွင့်လင်းရင်းမြစ် ဖောင်ဒေးရှင်းတစ်ခုအဖြစ် ရပ်တည်ကာ မြန်မာဘာသာစကားနှင့် တိုင်းရင်းသားဘာသာစကားများအတွက် စနစ်တကျ စိစစ်ထားသည့် အရည်အသွေးမြင့် ဒေတာအစုများကို အများပြည်သူ လွတ်လပ်စွာ အသုံးပြုနိုင်ရန် စုစည်းထုတ်ပြန်ပေးလျက်ရှိသည်။ ဤကဲ့သို့သော လှုပ်ရှားမှုများနှင့် ဒေတာအစု ဖန်တီးမှုများသည် မြန်မာ့ AI နည်းပညာဝန်းကျင် (AI Ecosystem) ဖွံ့ဖြိုးတိုးတက်လာစေရန်နှင့် နည်းပညာသစ် တီထွင်ဖန်တီးသူများအတွက် အခြေခံအုတ်မြစ် အရင်းအမြစ်များကို ဖြည့်ဆည်းပေးရန်အတွက် အရေးပါသော အခန်းကဏ္ဍမှ ပံ့ပိုးပေးလျက် ရှိသည်။

ကိုးကားချက်များ

[ပြင်ဆင်ရန်]
  1. 1 2 Fisher, R.A. (1963). "The Use of Multiple Measurements in Taxonomic Problems". Annals of Eugenics 7 (2): 179188. doi:10.1111/j.1469-1809.1936.tb02137.x.
  2. "'Big Data': Big gaps of knowledge in the field of Internet" (2012). International Journal of Internet Science 7: 1–5.
  3. European open data portal European Commission။ 2025-10-05 တွင် ပြန်စစ်ပြီး။
  4. DatarrX Foundation။ ကျွန်ုပ်တို့အကြောင်း (in my)။
  5. United Nations Statistical Commission; United Nations Economic Commission for Europe (2007)။ Statistical Data Editing: Impact on Data Quality: Volume 3 of Statistical Data Editing, Conference of European Statisticians Statistical standards and studies (PDF)။ United Nations Publications။ p. 20။ ISBN 978-9211169522
  6. UCI Machine Learning Repository: Iris Data Set 2023-04-26 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2025-10-05 တွင် ပြန်စစ်ပြီး။
  7. Textbook Examples An Introduction to Categorical Data Analysis by Alan Agresti 2023-01-31 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။ 2023-05-02 တွင် ပြန်စစ်ပြီး။
  8. The ROUSSEEUW datasets 2005-02-07 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။
  9. StatLib :: Data, Software and News from the Statistics Community 2011-01-02 တွင် မူရင်းအား မော်ကွန်းတင်ပြီး။