අන්තර්ගතයට යන්න
මෙය ඉංග්‍රීසි මුල් ලේඛනයේ පරිවර්තනයකි. දෙකෙහි වෙනසක් ඇත්නම් ඉංග්‍රීසි පිටපත නිවැරදි යැයි සලකන්න.

00: සිංහල අක්ෂර වින්‍යාසය: ඒකාබද්ධ නීති මාලාව ​

මෙම ගොනුව මාතෘකා අධ්‍යයන (01–06) එක් නීති ලැයිස්තුවකට ඒකාබද්ධ කරයි. එහි කිසිදු නීතියක් දෙවරක් නොයෙදේ. සෑම නීතියක්ම එය ගොඩනැගූ මූලාශ්‍ර නීති සඳහන් කරයි (උදා. 02:VS-007 = ගොනුව 02, නීතිය VS-007). 2026 ඔක්තෝබර් මාසයේ සම්පාදනය කරන ලදී.

  • අනිවාර්ය (HARD) = කේතනයේ හෝ අක්ෂර වින්‍යාසයේ නොවෙනස් නීතියකි. නිවැරදි පෙළක් එය කිසි විටෙක උල්ලංඝනය නොකරයි.
  • නැඹුරුව (SOFT) = අක්ෂර වින්‍යාසයේ පවතින නැඹුරුවකි. විය හැකි අක්ෂර වින්‍යාස පෙළගැස්වීමට එය භාවිත කරන්න. දැඩි පෙරහනක් ලෙස කිසි විටෙක භාවිත නොකරන්න.
  • විකල්ප (STYLE) = අක්ෂර වින්‍යාස දෙකක් හෝ වැඩි ගණනක් නිවැරදිය. තේරීම සම්මුතියක් පමණි.
  • විශ්වාසය: ඉහළ · මධ්‍යම · අඩු (මාතෘකා ගොනුවල ඇති අර්ථයම).

යන්ත්‍ර මගින් කියවිය හැකි සහායක ගොනු:

  • data/letters.json: අකුරු රූප 923 ම (ස්වර 18, ලකුණු 3, ව්‍යඤ්ජන රූප 41 × 19, සංයුක්ත අකුරු 41 × 3).
  • data/validity.json: එක් එක් රූපයේ තත්ත්වය (valid · loan · rare · unattested · never) සහ ඊට පදනම් වූ නීති. tools/build_data.py මෙම ගොනුව සාදයි.

1. කේතනයේ නොවෙනස් නීති (අනිවාර්ය) ​

IDනීතියවිශ්වාසයමූලාශ්‍ර
G-EN-01තාර්කික අනුපිළිවෙළට (logical order) ගබඩා කරන්න: මුලින් ව්‍යඤ්ජනය (හෝ මුළු පොකුරම), ඉන්පසු ස්වර ලකුණ. ව්‍යඤ්ජනයට පෙර දර්ශනය වන ෙ ේ ෛ ො ෝ ෞ සඳහාද මෙම නීතිය අදාළයඉහළ02:VS-002, 03:HC-023
G-EN-02පූර්ව සංයුක්ත ලකුණු භාවිත කරන්න: ේ U+0DDA, ො U+0DDC, ෝ U+0DDD, ෞ U+0DDE. ඒවායේ වියෝජිත කොටස් කිසි විටෙක භාවිත නොකරන්න. අමතර ආරක්ෂාවක් ලෙස පෙළ NFC ආකාරයට සාමාන්‍යකරණය කරන්නඉහළ01:INV-003, 02:VS-003
G-EN-03ෛ U+0DDB ට වියෝජනයක් නැත. ෙ+ෙ වෙනත් පෙළකි. එය වැරදි වුවද කිසිදු අනතුරු ඇඟවීමක් නොලැබේ. සැමවිට U+0DDB කේතනය කරන්නඉහළ01:INV-003, 02:VS-004
G-EN-04ෝ තුළ අනුපිළිවෙළ ෙ ා ් වේ. ෙ ් ා අනුක්‍රමය සාමාන්‍යකරණයේදී ේ + ා බවට පත් වේ. එය වැරදියඉහළ02:VS-005
G-EN-05ස්වතන්ත්‍ර ස්වර බෙදිය නොහැකි ඒකක වේ. අ+ා (ආ), අ+ැ, අ+ෑ, එ+් (ඒ), ඔ+් (ඕ), ඔ+ෟ, උ+ෟ, ඍ+ෘ, ඏ+ෟ, එ+ෙ කිසි විටෙක කේතනය නොකරන්නඉහළ01:INV-002, 02:VS-006
G-EN-06ව්‍යඤ්ජනද බෙදිය නොහැකි ඒකක වේ. සඤ්ඤක අකුරු 5, ඥ (U+0DA5, කිසි විටෙක ජ්‍ඤ නොවේ) සහ ෆ ද මීට අයත්යඉහළ01:INV-001, 03:HC-051
G-EN-07හල් ලකුණ තනිව අකුරු නොබඳියි. C ් C හි හල් ලකුණ සැමවිට පෙනේ. බැඳුණු රූපයකට ZWJ අවශ්‍යයඉහළ03:HC-001
G-EN-08ZWJ හි පිහිටීම විලාසය තීරණය කරයි: C ් ZWJ C = සංයුක්ත අකුර / යංශය / රකාරාංශය / රේඵය; C ZWJ ් C = ස්පර්ශ අකුරු (touching letters, පාලි). යුනිකේත සහ SLS 1134:2011 එකඟ වේ. 2004 SLS කෙටුම්පත ඊට වෙනස්යඉහළ03:HC-002/003, 01:INV-005
G-EN-09නම් කළ අනුක්‍රම: යංශය 0DCA 200D 0DBA · රකාරාංශය 0DCA 200D 0DBB · රේඵය 0DBB 0DCA 200Dඉහළ01:INV-006, 03:HC-004
G-EN-10සාමාන්‍ය පෙළෙහි ZWNJ නැතඉහළ03:HC-005
G-EN-11සන්දර්භය අනුව වෙනස් වන අක්ෂර රූප (කොකු සහිත u, රු රූ රැ රෑ ළු, u ට පෙර ද අකුරේ වලිගය නැති වීම, හල් ලකුණේ දෙවන හැඩය) අකුරු මුහුණතට (font) අදාළ කරුණු වේ. කේතනය සාමාන්‍ය ව්‍යඤ්ජනය + ලකුණ ලෙසම පවතීඉහළ01:INV-009/010, 02:VS-011…017
G-EN-12සැබෑ පෙළ සංග්‍රහවල (corpus) ZWJ නැති පෙළ (ශ්රී, අක්ෂර) හමු වන බව අපේක්ෂා කරන්න. ගැළපීම සඳහා ඒවා එකම රූපයකට ගෙන එන්න. පෙළ නිපදවීමේදී කිසි විටෙක ZWJ ඉවත් නොකරන්නඉහළ03:HC-050, 03:§10.12, 05:SP-011

2. ස්වර සහ ස්වර ලකුණු ​

IDනීතියවර්ගයවිශ්වාසයමූලාශ්‍ර
G-VS-01පරායත්ත ලකුණු 17 + හල් ලකුණ. සෑම ව්‍යඤ්ජනයකටම රූප 19ක් ඇත: හල්, ආවේණික “අ” ස්වරය, සහ ලකුණු 17අනිවාර්යඉහළ01:§2d, 02:VS-001
G-VS-02වචනයක මුලදී ස්වතන්ත්‍ර ස්වර අකුර භාවිත වේ. වචනයක් තුළ ව්‍යඤ්ජනයකට පසු එන ස්වරය සැමවිට ලකුණකිඅනිවාර්යඉහළ02:VS-029, 05:PH-009
G-VS-03ස්වතන්ත්‍ර ස්වරයකට පසු ස්වර ලකුණක් නොයෙදේ (ඉී, ඔා). හැඩගැන්වීමේ මෘදුකාංග (shapers) සාමාන්‍යයෙන් මේ ගැන අනතුරු නොඅඟවයිඅනිවාර්යඉහළ02:VS-007
G-VS-04හල් ලකුණට පසු ස්වර ලකුණක් නොයෙදේ (ක්ා). එක් ව්‍යඤ්ජනයකට යෙදිය හැක්කේ එක් ස්වර ලකුණක් පමණි (කාා). ලකුණකට පසු යෙදිය හැක්කේ ං/ඃ පමණිඅනිවාර්යඉහළ02:VS-009/010
G-VS-05පාදකයක් නැති ලකුණක් පෙළෙහි වලංගු නොවේඅනිවාර්යඉහළ02:VS-008
G-VS-06ස්වර දෙකක් එක ළඟ යෙදීම (hiatus) අර්ධ ස්වරයක් යොදා නිවැරදි කෙරේ: i/ii/e/ee/ae/aee ට පසු ය, u/uu/o/oo/aa ට පසු ව (රැය, තොප්පිය, මාලිගාව). කෙටි a ට පසු සාමාන්‍යයෙන් අර්ධ ස්වරයක් වෙනුවට ස්වරය ලොප් වේ (පොතේ)නැඹුරුවඉහළ (අර්ධ ස්වරය), අඩු (a ට පසු)02:VS-030, 05:SN-010, 05:PH-009
G-VS-07දේශීය සහ ඉංග්‍රීසි වචනවල කථනයේ ඇති ද්විස්වර (diphthongs) V + යි / V + වු ලෙස ලියයි (අයියා, ළමයි, කවුද, ලයිට්)නැඹුරුවඉහළ02:VS-022, 05:PH-010
G-VS-08ඏ ඐ ෟ (තනිව) ෳ නූතන සිංහලයේ භාවිත නොවේ. ඎ අකුර භාවිතයෙන් ඉවත් වී ඇත (එහි ලකුණ ෲ වචන කිහිපයක ඉතිරිව ඇත). ෟ ඉතිරිව ඇත්තේ ෞ/ඖ තුළ පමණිඅනිවාර්ය (සාමාන්‍ය ප්‍රකාරයේදී)ඉහළ01:INV-018, 02:VS-021
G-VS-09ස්වර දිග අර්ථය වෙනස් කරයි (phonemic). සෑම කෙටි ලකුණකටම එක් දීර්ඝ ලකුණක් ඇත: a→aa, ae→aee, i→ii, u→uu, e→ee, o→oo, ru→ruuඅනිවාර්යඉහළ02:VS-032
G-VS-10u/uu සමඟ ර සහ ළ අක්‍රමවත් අක්ෂර රූප ගනී (ae/aee සමඟ ර ද). කිසි විටෙක "දෘශ්‍ය" ආදේශකයක් කේතනය නොකරන්නඅනිවාර්යඉහළ02:VS-011…013
G-VS-11ෛ ෞ (සහ ඍ ඓ ඖ) යෙදෙන්නේ සංස්කෘත ණය වචනවල පමණි. ෘ ෲ සංස්කෘත ṛ ලිවීමට යෙදේ. අනෙක් වචනවල සහ ඉංග්‍රීසි ණය වචනවල ව්‍යඤ්ජනයකට පසු /ru, ruː/ ලියන සුලබ ක්‍රමයද ඒවාය (G-VS-15). ැ/ෑ (ඇ ඈ) පැහැදිලිවම සිංහලයට ආවේණිකය. සංස්කෘත වචනවල ඒවා නැති තරම්යනැඹුරුවඉහළ02:VS-019/020/022/034, 05:SN-012
G-VS-12"ru" ලෙස කියවෙන ආකාර තුනකි: ර+ු, ෘ, සහ රකාරාංශය+ු. ගෘහ (නිවස) ≠ ග්‍රහ (ග්‍රහලෝකය). ක්‍රු/ක්‍රූ කේතනය කළ යුත්තේ ු/ූ සමඟය, කිසි විටෙක ැ/ෑ සමඟ නොවේ (ක්‍රෑර වැරදිය)අනිවාර්ය (කේතනය), නැඹුරුව (තේරීම)ඉහළ02:VS-012/016/020/034, 03:HC-024, 05:G2P-011
G-VS-13එක් එක් ව්‍යඤ්ජනයට කුමන ලකුණු වලංගුද යන්න (41 × 17): data/validity.json බලන්න. මහාප්‍රාණ අකුරු ැ/ෑ ගන්නේ කලාතුරකිනි. ළ දීර්ඝ ලකුණු ගන්නේ කලාතුරකිනි. සඤ්ඤක අකුරුද දීර්ඝ ලකුණු ගන්නේ කලාතුරකිනිනැඹුරුවමධ්‍යම02:§8
G-VS-14්‍ය පොකුරුවල SLS ලැයිස්තුගත කරන්නේ a aa u uu e ee o oo ය. ්‍ර පොකුරුවල ලැයිස්තුව a aa ae aee i ii e ee ai o oo au ය. u uu ද යෙදේ (SLS ඒවා අතහැර ඇත; ඒවා වලංගු නමුත් දුර්ලභය, G-VS-15 බලන්න). අනෙක් සංයෝජනද කේතනය කළ හැකියනැඹුරුවඉහළ01:INV-018, 02:VS-016, 03:HC-020/021
G-VS-15C + r + u/uu ට නිවැරදි අක්ෂර වින්‍යාස දෙකක් ඇත: C + ෘ/ෲ (කෲර, මෘදු, ගෲප්) සහ රකාරාංශය + ු/ූ (ක්‍රූර). දෙකම /Cru(ː)/ ලෙස කියවේ. ෘ/ෲ වඩා සුලබය: එකකට වැඩි අක්ෂර වින්‍යාසයකින් භාවිතයේ හමු වූ වචන 205න් 155ක වැඩිම සංඛ්‍යාතය ඇත්තේ එයටයි (CC-02). පෙනුමෙන් සමාන රකාරාංශය + ැ/ෑ කිසි විටෙක නිවැරදි නොවේ (G-VS-12)විකල්පඉහළ02:VS-020/034, 03:HC-024

3. හල් ලකුණ සහ ව්‍යඤ්ජන පොකුරු ​

IDනීතියවර්ගයවිශ්වාසයමූලාශ්‍ර
G-HC-01පසුව ස්වරයක් නොඑන ව්‍යඤ්ජනයකට හල් ලකුණ යෙදේ. වචනයක අවසානය (පොතක්, මල්), වෙනත් ව්‍යඤ්ජනයකට පෙර තැන, සහ ද්විත්ව ව්‍යඤ්ජන (geminates) මීට අයත්යඅනිවාර්යඉහළ03:HC-010/012/013
G-HC-02උච්චාරණය කිසි විටෙක හල් ලකුණ තීරණය නොකරයි. ආවේණික “අ” ස්වරය [a] ලෙසද [ə] ලෙසද උච්චාරණය වන්නේ යන්න ලිවීමේදී නොපෙන්වයිඅනිවාර්යඉහළ03:HC-010/011, 05:G2P-001
G-HC-03ද්විත්ව ව්‍යඤ්ජන ZWJ නැතිව C ් C ලෙස ලියයි (අම්මා, අක්කා, පත්තරය)අනිවාර්යඉහළ03:HC-042, 05:PH-008
G-HC-04මෙම අකුරු කිසි විටෙක ද්විත්ව නොවේ: ඟ ඬ ඳ ඹ ඦ ඞ ෆ හ ශ (පඬි වහරේ ශ්ශ ඇත: නිශ්ශබ්ද), සහ ළඅනිවාර්යඉහළ03:HC-042, 05:PH-008, 04:NS-075
G-HC-05දේශීය අක්ෂරවල (syllables) ආකාරය (C)V(C) වේ. ඒවායේ මුලදී ව්‍යඤ්ජන පොකුරු නැත. මුලදී පොකුරු ඇත්තේ තත්සම හෝ ඉංග්‍රීසි වචනවලය (ප්‍ර, ස්ව, ස්ටේෂන්)නැඹුරුවඉහළ03:HC-040, 05:PH-001
G-HC-06සඤ්ඤක ඟ ඦ ඬ ඳ ඹ කිසි විටෙක හල් ලකුණ නොගනී. එබැවින් ඒවාට පසු ්‍ය/්‍ර කිසි විටෙක නොයෙදේ. ඒවා කිසි විටෙක වචන මුලට නොඑයිඅනිවාර්යඉහළ02:VS-025, 03:HC-014, 04:NS-031, 05:PH-003
G-HC-07ළ කිසි විටෙක හල් ලකුණ නොගනී (ප්‍රකෘතියක අවසාන ළ, ළ ලෙසම පවතී; ද්විත්ව l ලියන්නේ ල්ල ලෙසය)අනිවාර්යමධ්‍යම03:HC-014, 04:NS-058/075
G-HC-08ඞ යෙදෙන්නේ ඞ් ලෙස පමණි (කණ්ඨජයකට පෙර, පාලි හෝ පඬි වහරේ වචනවල). එය කිසි විටෙක ස්වර ලකුණක් නොගනී. නූතන අක්ෂර වින්‍යාසය ං භාවිත කරයිඅනිවාර්යඉහළ01:INV-018, 02:VS-023, 04:NS-040
G-HC-09ණ කිසි විටෙක හල් ලකුණ සමඟ ප්‍රකෘතියක් අවසන් නොකරයි (අවසාන ව්‍යඤ්ජනය න් ලෙස මතු වේ). පොකුරු තුළ ණ් යෙදීම ගැටලුවක් නොවේ (ණ්ඩ)නැඹුරුවමධ්‍යම04:NS-058
G-HC-10දිගු පොකුරක ව්‍යඤ්ජන එක් වන සෑම තැනක්ම ස්වාධීනය: ZWJ යොදන්නේ සංක්ෂිප්ත රූපයක් අවශ්‍ය තැන්වල පමණි (ස්ත්‍රී, රාෂ්ට්‍ර, ශාස්ත්‍ර)අනිවාර්යඉහළ03:HC-044
G-HC-11C + ය සඳහා යංශය අනිවාර්යය: C ් ZWJ ය (වාක්‍ය, විද්‍යාව). ZWJ නැති වාක්ය පිළිගත නොහැකියඅනිවාර්යඉහළ03:HC-020, 05:SP-012
G-HC-12C + ර සඳහා රකාරාංශය අනිවාර්යය: C ් ZWJ ර (ක්‍රම, ශ්‍රී, ප්‍රශ්නය). ම, න, ල ට පසු ර සාමාන්‍යයෙන් නව අක්ෂරයක් අරඹන බැවින් සාමාන්‍ය හල් ලකුණ ගනී (දුම්රිය, හෙන්රි). ම්‍ර (තාම්‍ර) වලංගු කේතනයක් වුවද දුර්ලභයඅනිවාර්යඉහළ (නීතිය), මධ්‍යම (m/n/l භාවිතය)03:HC-021/052
G-HC-13රේඵය විකල්ප විලාසයකි: ර් + C හෝ ර ් ZWJ + C, දෙකම නිවැරදිය (කර්ම / කර්‍ම)විකල්පඉහළ01:INV-006, 03:HC-022
G-HC-14ර ට පසු යංශය නොයෙදේ (SLS 1134). ර ් ZWJ ය රේඵය + ය ලෙස සැලකේ. kārya සඳහා පිළිගත් අක්ෂර වින්‍යාස 3ක් ඇත: කාර්‍ය්‍ය (සාම්ප්‍රදායික), කාර්‍ය, කාර්ය. ර්‍ර භාවිතයේ හමු නොවේඅනිවාර්ය (ර+යංශය), සැලසුම් තීරණය (kārya ලියන ආකාරය)ඉහළ03:HC-033/034/054, 05:PH-012
G-HC-15අනෙක් සංයුක්ත අකුරු (බැඳි අකුරු) විකල්ප වන අතර බොහෝ දුරට සම්භාව්‍ය වේ. තවමත් දැකිය හැකි ඒවා: ක්‍ෂ, ක්‍ව, න්‍ද, න්‍ධ, න්‍ථ, ත්‍ථ. සමකාලීන නොවන ඒවා: ද්‍ධ, ද්‍ව, ට්‍ඨ, ඤ්‍ච. නූතන පෙරනිමිය සාමාන්‍ය හල් ලකුණයිවිකල්පමධ්‍යම03:HC-030, 03:§9b
G-HC-16ක්ෂ සහ ක්‍ෂ යනු kṣ හි එකම අක්ෂර වින්‍යාසයේ රූප දෙකකි. දෙකම සුලබයවිකල්පඉහළ03:HC-032, 05:SP-011
G-HC-17ස්පර්ශ අකුරු C ZWJ ් C යෙදෙන්නේ පාලි/සම්භාව්‍ය පෙළවල පමණි. ඒවාට SLS Level 3 අකුරු මුහුණත් අවශ්‍යය. එවැනි මුහුණත් නැති තරම්යවිකල්පඉහළ03:HC-031/062
G-HC-18-tva වචනවලට පිළිගත් අක්ෂර වින්‍යාස දෙකක් ඇත. තත්ත්වය / සත්ත්වයා ව්‍යාකරණානුකූල රූපයයි (සංස්කෘත tat + tva). කෙටි කළ තත්වය / සත්වයා නූතන රූපය වන අතර එයද වලංගු ලෙස පිළිගැනේ. දෙකම සුලබය. මේ ගැන නිල තීන්දුවක් නැතවිකල්පමධ්‍යම03:HC-043, 05:SP-008

4. නාසික සහ අයෝගවාහ ලකුණු ​

IDනීතියවර්ගයවිශ්වාසයමූලාශ්‍ර
G-NS-01ං යෙදෙන්නේ ස්වරයකට, ව්‍යඤ්ජනයකට (+ ලකුණ) හෝ සඤ්ඤකයකට පසුවය. එය කිසි විටෙක වචන මුලට නොඑයි, හල් ලකුණකට පසු නොයෙදේ, ලකුණක් නොගනී, සහ සැමවිට තම පොකුරේ අවසානයට එයිඅනිවාර්යඉහළ01:INV-008, 04:NS-001/002, 05:PH-004
G-NS-02ං = [ŋ]. එය ඞ් (සහ බොහෝ විට ඤ්) වෙනුවට භාවිතයට පැමිණ ඇත: ලංකාව, මංගල, වංචාවනැඹුරුවමධ්‍යම04:NS-003/004
G-NS-03ව්‍යඤ්ජනයකට පෙර නාසිකය (තත්සම): k/g කාණ්ඩය සහ y r l v ś ṣ s h → ං; ට/ඩ කාණ්ඩය → ණ්; ත/ද කාණ්ඩය → න්; ප/බ කාණ්ඩය → ම්; c/j කාණ්ඩය → ං (නූතන) හෝ ඤ් (පාලි). දේශීය වචන ස ට පෙර න් භාවිත කරයි (පන්සල)නැඹුරුවඉහළ (මූර්ධජ, දන්තජ), මධ්‍යම (අනෙක්)04:NS-005/043/055/056, 05:SP-009
G-NS-04sam- + ස්වරය → ම + ලකුණ (සමාගම). වචනයක් තුළ ං කිසි විටෙක ස්වරයකට පෙර නොයෙදේඅනිවාර්යමධ්‍යම04:NS-006/010
G-NS-05ඃ දුර්ලභය. එය සංස්කෘත වචනවල පමණක් යෙදෙන අතර [h] ලෙස උච්චාරණය වේ. එහි පිහිටීමේ නීති ං හි නීතිම වේ. සංස්කෘත විසර්ගය බොහෝ විට සන්ධිය හරහා ෝ / ර් / ශ් / ස් / ෂ් ලෙස මතු වේ. එය ශබ්දය පමණක් අනුව කිසි විටෙක පුරෝකථනය කළ නොහැකියනැඹුරුවඉහළ04:NS-020…023, 05:SN-011
G-NS-06ඁ චන්ද්‍රබින්දුව නූතන සිංහලයට අයත් නොවේ. නූතන පෙළෙහි එයට තැනක් නැතඅනිවාර්යඉහළ01:INV-011, 04:NS-025
G-NS-07සඤ්ඤකය = ඝෝෂ ස්පර්ශයකට (voiced stop) බැඳුණු කෙටි නාසිකයකි (ඞ+ග, ඤ+ජ, ණ+ඩ, න+ද, ම+බ). එය නාසිකය + හල් + ස්පර්ශය යන පොකුරෙන් වෙනස් වේ: කඳ (ගසේ කඳ) ≠ කන්ද (පර්වතය), අඟල ≠ අංගයඅනිවාර්ය (අර්ථ භේදය)ඉහළ01:INV-021, 04:NS-030/032, 05:SP-010
G-NS-08සඤ්ඤකයද පොකුරද යන්න වචනය අනුව තීරණය වේ. තත්සම වචන කිසි විටෙක සඤ්ඤක භාවිත නොකරයි. දේශීය සහ තද්භව වචන බොහෝ විට ඒවා භාවිත කරයි. ඉංග්‍රීසි ණය වචන පොකුරු භාවිත කරයි (ලන්ඩන්). සමහර වචන දෙකම පිළිගනී (මග/මඟ)නැඹුරුවමධ්‍යම04:NS-033/034
G-NS-09සඤ්ඤකයකට පෙර කිසිදු නාසිකයක් නොයෙදේ (අංඹ නැත, න්ඳ නැත)අනිවාර්යමධ්‍යම04:NS-037
G-NS-10සමාසවල සඤ්ඤකයක් + ව්‍යඤ්ජනයක් → ං හෝ හල් සහිත නාසිකයක් (ගඟ + වතුර → ගංවතුර)නැඹුරුවඉහළ05:SN-007, 04:NS-007
G-NS-11ඦ ප්‍රායෝගිකව භාවිත නොවේ. එය අකුරු මාලාවේ තබා ගන්න, නමුත් භාවිතයෙන් ඉවත් වූ අකුරක් ලෙස සලකන්නනැඹුරුවඉහළ01:§8, 04:NS-036
G-NS-12ඥ = සංස්කෘත jñ (ඥානය, ප්‍රඥාව, -ඥ ප්‍රත්‍යය). gn සැමවිටම ඥ නොවේ (අග්නි, නග්න, ලග්න)නැඹුරුවඉහළ04:NS-042/046
G-NS-13ny සාමාන්‍යයෙන් න්‍ය වේ (අන්‍ය, ශූන්‍ය, ධන්‍ය). ඤ දුර්ලභය (ඤාණ, පඤ්ච, සඤ්ඤා)නැඹුරුවඉහළ04:NS-041/047
G-NS-14වචන අවසානයේ ං, අවසාන ම් / න් වලින් වෙනස් වේ (දං ≠ දන්). කථන වහරේ අවසාන ං, විධිමත් ම්/න් වෙනුවට යෙදේ (මං, එහෙනං)නැඹුරුවමධ්‍යම04:NS-008/009
G-NS-15කථනයේ අවසාන [ŋ] ං, න් හෝ ම් ලෙස ලිවිය හැකිය (මිනිසුන් උච්චාරණය වන්නේ minisuŋ ලෙසය). වචන අවසානයේ ඇති රෝමානුකෘත -ng අපැහැදිලියනැඹුරුවමධ්‍යම03:HC-012, 05:PH-007

5. ශබ්ද සංයෝජන නීති (phonotactics) සහ සන්ධි ​

IDනීතියවර්ගයවිශ්වාසයමූලාශ්‍ර
G-PH-01වචන මුලට නොඑන දේ: සඤ්ඤක අකුරු, ඞ, ං, ඃ, ඎ. ණ වචන මුලට එන්නේ ණය යන වචනයේ පමණි (පුරාතන වචන කිහිපයක්ද ඇත). ළ වචන මුලට යෙදිය හැකිය (ළමයා)අනිවාර්ය (ණ හැර)ඉහළ04:NS-031/057, 05:PH-003…006
G-PH-02වචන අවසන් වන්නේ ස්වරයකින්, හල් සහිත ව්‍යඤ්ජනයකින් හෝ ං වලිනි. කිසි විටෙක සඤ්ඤකයකින් අවසන් නොවේ. ළ/ණ වචනයක් අවසන් කරන්නේ ස්වරයක් සමඟ පමණිඅනිවාර්යඉහළ05:PH-007, 04:NS-058
G-PH-03වචනයක් තුළ ස්වර දෙකක් එක ළඟ යෙදෙන්නේ සමාස සීමාවල සහ ස්ථාන නාමවල පමණි (ගිරිඋල්ල). රෝමානුකරණයකට එය ප්‍රකාශ කිරීමට පැහැදිලි වෙන් කිරීමේ සලකුණක් අවශ්‍යයනැඹුරුවඉහළ05:PH-009, 02:VS-029
G-PH-04පාසල් ව්‍යාකරණයේ සන්ධි වර්ග 10 සහ ස්ථිර වූ සංස්කෘත සන්ධි (dīrgha, guṇa, vṛddhi, yaṇ, visarga) පඬි වහරේ බොහෝ අක්ෂර වින්‍යාස පැහැදිලි කරයි (ඉත්‍යාදි, නිර්මාණ, දුෂ්කර, පෞද්ගලික). ඒවා එක් එක් වචනයට අයත් කරුණු මිස, නව වචනවලටද අදාළ වන (productive) නීති නොවේනැඹුරුවමධ්‍යම05:SN-001…014

6. අක්ෂර වින්‍යාස භේද (එක ලෙස උච්චාරණය වන අකුරු): නීති මත නොව වචනය මත පදනම් වේ ​

IDනීතියවර්ගයවිශ්වාසයමූලාශ්‍ර
G-SP-01මෙම කාණ්ඩවල අකුරු එක ලෙස උච්චාරණය වේ: {ක ඛ} {ග ඝ} {ච ඡ} {ජ ඣ} {ට ඨ} {ඩ ඪ} {ත ථ} {ද ධ} {ප ඵ} {බ භ} {න ණ} {ල ළ} {ස ශ ෂ} {ඤ ඥ}. ශබ්දයෙන් අකුර තෝරා ගත නොහැකිය. පෙළ සංග්‍රහය අනුව පෙළගැස්වූ ශබ්දකෝෂයක් (lexicon) එය කළ යුතුය (එක් අධ්‍යයනයක් පෙළගැස්වීම පමණක් භාවිතයෙන් 82% ක නිරවද්‍යතාවක් ලබා ගත්තේය)නැඹුරුවඉහළ01:INV-023, 05:G2P-010, 05:SP-003…006
G-SP-02ණ: නාමවල ර / ෂ / ඍ ට පසු, ඒ අතරට දන්තජයක්, තාලුජයක්, මූර්ධජයක්, ල, ශ හෝ ස නොඑන්නේ නම් (ṇatva නීතිය); ට/ඩ ට පෙර; ගෞරව වාචී පදවල (-ආණ, -අණි); අතීත/කර්ම කාරක රූපවල (-ඉණි, -උණු)නැඹුරුවඉහළ04:NS-051…060, 05:SP-003
G-SP-03න: ර ට පසු වුවද දේශීය ක්‍රියාපදවල (මරන ≠ මරණ); දන්තජ සහ ස ට පෙර; ස/ශ ට පසු; ද්විත්ව ව්‍යඤ්ජනවල; සමාස සීමාවලනැඹුරුවඉහළ04:NS-056/061…063, 05:SP-003
G-SP-04ළ: ර-ධාතුවල අතීත රූපවල (කර → කළ); පිළි- උපසර්ගයේ; "කුඩා / ළදරු" අර්ථ ඇති වචනවල (ළමා); l…l නාමයක පළමු l ලෙස; සඤ්ඤකයකට පෙර (විශ්වාසය මධ්‍යම); පාලි/සංස්කෘත මූර්ධජවලින් පැවත එන තැන්වල (පොළොව)නැඹුරුවඉහළ04:NS-071…079, 05:SP-004
G-SP-05ස / ශ / ෂ: දේශීය වචන ස භාවිත කරයි. ශ තාලුජ සමඟ, ව ට පෙර, ශ්‍ර තුළ, සහ ඌෂ්ම (sibilants) දෙකක පළමුවැන්න ලෙස යෙදේ. ෂ මූර්ධජවලට පෙර, ක්ෂ තුළ, a/aa හැර අනෙක් ස්වරවලට පසු k/p ට පෙර (ruki), සහ -ඉෂ්ඨ තුළ යෙදේ. ස දන්තජවලට පෙර යෙදේනැඹුරුවඉහළ04:NS-080…087, 05:SP-005
G-SP-06මහාප්‍රාණ අකුරු සඳහා නීතියක් නැත. ඒවා වචනයෙන් වචනය ඉගෙන ගත යුතුය. සමහර වචනවලට පිළිගත් විකල්ප ඇත (කථා/කතා)නැඹුරුවඉහළ05:SP-006
G-SP-07ස්වර දිග සම්බන්ධ වැරදි වඩාත්ම සුලබය. ක්‍රියා නාම ප්‍රත්‍යය දීර්ඝ -ීම වේ (කිරීම)නැඹුරුවඉහළ02:VS-033, 05:SP-007
G-SP-08අර්ථයෙන් වෙනස් යුගල වෙන් වෙන්ව තිබිය යුතුය: කණ/කන, වණ/වන, කල/කළ, පල/පළ, මරණ/මරනනැඹුරුවඉහළ04:§6, 05:SP-003/004

7. සිංහල ලතින් අකුරින් ලිවීම (අවිධිමත් රෝමානුකරණය) ​

මෙම සොයාගැනීම් සිංහල මව් භාෂාව කතා කරන්නන්ගේ රෝමානුකරණ ඇතුළත් Dakshina පෙළ සංග්‍රහයෙන් මැන ඇත. 06-romanization.md බලන්න. මෙම ගොනුවේ ඇති සෑම පෙළ සංග්‍රහ සංඛ්‍යාවක්ම tools/corpus_counts.py මගින් නැවත ගණනය කළ හැක (reports/corpus-counts.md).

IDසොයාගැනීමවිශ්වාසයමූලාශ්‍ර
G-TY-01th = ත සහ t = ට යන්න සියල්ලන්ම පාහේ භාවිත කරයි (93–99%)ඉහළ06:RS-001
G-TY-02ද d ලෙස ලියයි (99%). ධ dh ලෙස ලියයිඉහළ06:RS-002/003
G-TY-03ී අවස්ථාවලින් 38% ක ee ලෙසද, ූ 22% ක oo ලෙසද ලියයිඉහළ06:RS-006/007
G-TY-04ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි: ා අවස්ථාවලින් 97% ක a ලෙස ලියයිඉහළ06:RS-009
G-TY-05අවිධිමත් කතාබහේදී ස්වර අතහැරේ (nthi, mta). ඒවා නැවත ලබා ගත හැක්කේ ශබ්දකෝෂයකින් හෝ ආසන්න ගැළපීමකින් (fuzzy matching) පමණිඉහළ06:RS-010
G-TY-06ඳ ඹ ඟ nd mb ng ලෙස ලියයි (ඳ = nd 91%). ං n ලෙස ලියයි (91%)ඉහළ06:RS-012/014
G-TY-07ඇ e හෝ a ලෙස ලියයි. ae ලෙස ලියන්නේ කලාතුරකිනිඉහළ06:RS-008
G-TY-08අවිධිමත් ලිවීමේදී මූර්ධජ ණ / ළ කිසි විටෙක වෙන් කර නොදක්වයි (සැමවිට n, l)ඉහළ06:RS-025
G-TY-09අවධාරණය නොවන [ə] ස්වරය (schwa) a ලෙස ලියයි (සමහර විට e): karanawa / keranawa = කරනවා. නියමිත අනුපිළිවෙළට යොදන schwa නීති (98% නිවැරදි) එය පුරෝකථනය කරයිඉහළ05:G2P-001…009, 03:HC-011
G-TY-10w සහ v දෙකම ව නියෝජනය කරයි. බොහෝ දෙනා w තෝරා ගනී (72%)ඉහළ06:RS-011

8. ණය වචන සම්මුති ​

IDනීතියවිශ්වාසයමූලාශ්‍ර
G-LW-01f → ෆ (පැරණි ණය වචනවල ප: කෝපි)ඉහළ05:LW-001, 01:INV-022
G-LW-02v/w → ව; z → ස; ʒ → ජ; θ → තමධ්‍යම05:LW-002/006/008
G-LW-03æ → ඇ හෝ ඈ (ඒකාක්ෂර වචන ඈ දෙසට නැඹුරු වේ: ෆෑන්, බෑග්; බහු අක්ෂර වචන ඇ ගනී: බැංකුව). දෙකම යෙදේමධ්‍යම05:LW-003
G-LW-04ɒ → ඔ; əʊ / ɔː → ඕ; ඉංග්‍රීසි schwa සහ -er → අ / -අර්ඉහළ05:LW-004/005
G-LW-05sh → ෂ (ජනප්‍රිය), සමහර විට ශ; x → ක්ස් (කිසි විටෙක ක්ෂ නොවේ); -ng → ං (ඉංග්‍රීසි)මධ්‍යම05:LW-007/009/012
G-LW-06ණය වචන අවසාන හල් ලකුණ තබා ගනී (බස්, ෆෝන්). සාහිත්‍ය රූප -ය/-ව එක් කරයි (බෝලය, නෝට්ටුව)ඉහළ05:LW-011

9. මෙම නීති මත ගොඩනැගූ ශබ්දානුසාරී රෝමානුකරණයක් ​

07-phonetic-romanization.md ශබ්දානුසාරී රෝමානුකරණයක් (සම්මුති R-01…R-15) නිර්වචනය කරයි. එය ඉහත සෑම නීතියක්ම කේතනය කරයි: නීති අවසර දෙන අකුරු රූප 791 ම එයින් නිපදවිය හැකිය. සියලු අවස්ථා පරීක්ෂා කළ විට, එය කිසි විටෙක තහනම් අනුක්‍රමයක් නොනිපදවයි.


10. විසඳා නැති ප්‍රශ්න සහ ගැටුම් ​

#විසඳා නැති ප්‍රශ්නයබලපාන තැන
1NIE පෙළපොත්, SLS 1134:2004/2011 හි අවසාන පිටපත් සහ Sinhala Lekhana Rīthiya (1989) පරිශීලනය කර නැත. පාසල් ව්‍යාකරණ නීති පදනම් වන්නේ එකිනෙකට එකඟ වන ද්විතීයික මූලාශ්‍ර මතයG-SP-*, G-HC-07, හෝඩියේ අකුරු ගණන්
241 × 17 වලංගුභාව වගුව සංශ්ලේෂණයකි, පෙළ සංග්‍රහයකින් ගණන් කළ එකක් නොවේ. පෙළ සංග්‍රහයකට එරෙහිව පරීක්ෂා කර ඇත්තේ ෘ / ෲ තීරු පමණි (02:VS-035)G-VS-13 / validity.json
3ස්පර්ශ අකුරු සහ රේඵය සමඟ යංශය යන දෙකෙහි කේතන SLS කෙටුම්පත් අතර වෙනස් වියG-EN-08, G-HC-14
4ම්‍ර / න්‍ර / ල්‍ර කිසිදු සිංහල මූලාශ්‍රයක භාවිතයේ හමු නොවේ. සාමාන්‍ය ම්ර / න්ර භාවිතයේ හමු වේ (03:HC-052)G-HC-12, R-07
5ය ර ල ව ශ ස හ ට පෙර ං සැබවින්ම උච්චාරණය වන ආකාරයG-NS-02/03

නිර්දේශිත ඊළඟ පියවර: සිංහල පෙළ සංග්‍රහයක (Wikipedia dump හෝ UCSC 10M) ව්‍යඤ්ජනය + ලකුණ සහ පොකුරු යුගල (bigrams) ගණන් කරන්න. එවිට validity.json සංශ්ලේෂණයක සිට මනින ලද දත්ත බවට පත් වේ. එමෙන්ම අපැහැදිලිතාව විසඳන ස්තරයට (disambiguation layer) වඩා හොඳ ශබ්දකෝෂයක් ලැබේ.


පෙළ සහ කේතය MIT බලපත්‍රය යටතේ නිකුත් කර ඇත. උපුටා දක්වන්න: doi:10.5281/zenodo.23244126.