00: සිංහල අක්ෂර වින්යාසය: ඒකාබද්ධ නීති මාලාව
මෙම ගොනුව මාතෘකා අධ්යයන (01–06) එක් නීති ලැයිස්තුවකට ඒකාබද්ධ කරයි. එහි කිසිදු නීතියක් දෙවරක් නොයෙදේ. සෑම නීතියක්ම එය ගොඩනැගූ මූලාශ්ර නීති සඳහන් කරයි (උදා. 02:VS-007 = ගොනුව 02, නීතිය VS-007). 2026 ඔක්තෝබර් මාසයේ සම්පාදනය කරන ලදී.
- අනිවාර්ය (HARD) = කේතනයේ හෝ අක්ෂර වින්යාසයේ නොවෙනස් නීතියකි. නිවැරදි පෙළක් එය කිසි විටෙක උල්ලංඝනය නොකරයි.
- නැඹුරුව (SOFT) = අක්ෂර වින්යාසයේ පවතින නැඹුරුවකි. විය හැකි අක්ෂර වින්යාස පෙළගැස්වීමට එය භාවිත කරන්න. දැඩි පෙරහනක් ලෙස කිසි විටෙක භාවිත නොකරන්න.
- විකල්ප (STYLE) = අක්ෂර වින්යාස දෙකක් හෝ වැඩි ගණනක් නිවැරදිය. තේරීම සම්මුතියක් පමණි.
- විශ්වාසය: ඉහළ · මධ්යම · අඩු (මාතෘකා ගොනුවල ඇති අර්ථයම).
යන්ත්ර මගින් කියවිය හැකි සහායක ගොනු:
data/letters.json: අකුරු රූප 923 ම (ස්වර 18, ලකුණු 3, ව්යඤ්ජන රූප 41 × 19, සංයුක්ත අකුරු 41 × 3).data/validity.json: එක් එක් රූපයේ තත්ත්වය (valid·loan·rare·unattested·never) සහ ඊට පදනම් වූ නීති.tools/build_data.pyමෙම ගොනුව සාදයි.
1. කේතනයේ නොවෙනස් නීති (අනිවාර්ය)
| ID | නීතිය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|
| G-EN-01 | තාර්කික අනුපිළිවෙළට (logical order) ගබඩා කරන්න: මුලින් ව්යඤ්ජනය (හෝ මුළු පොකුරම), ඉන්පසු ස්වර ලකුණ. ව්යඤ්ජනයට පෙර දර්ශනය වන ෙ ේ ෛ ො ෝ ෞ සඳහාද මෙම නීතිය අදාළය | ඉහළ | 02:VS-002, 03:HC-023 |
| G-EN-02 | පූර්ව සංයුක්ත ලකුණු භාවිත කරන්න: ේ U+0DDA, ො U+0DDC, ෝ U+0DDD, ෞ U+0DDE. ඒවායේ වියෝජිත කොටස් කිසි විටෙක භාවිත නොකරන්න. අමතර ආරක්ෂාවක් ලෙස පෙළ NFC ආකාරයට සාමාන්යකරණය කරන්න | ඉහළ | 01:INV-003, 02:VS-003 |
| G-EN-03 | ෛ U+0DDB ට වියෝජනයක් නැත. ෙ+ෙ වෙනත් පෙළකි. එය වැරදි වුවද කිසිදු අනතුරු ඇඟවීමක් නොලැබේ. සැමවිට U+0DDB කේතනය කරන්න | ඉහළ | 01:INV-003, 02:VS-004 |
| G-EN-04 | ෝ තුළ අනුපිළිවෙළ ෙ ා ් වේ. ෙ ් ා අනුක්රමය සාමාන්යකරණයේදී ේ + ා බවට පත් වේ. එය වැරදිය | ඉහළ | 02:VS-005 |
| G-EN-05 | ස්වතන්ත්ර ස්වර බෙදිය නොහැකි ඒකක වේ. අ+ා (ආ), අ+ැ, අ+ෑ, එ+් (ඒ), ඔ+් (ඕ), ඔ+ෟ, උ+ෟ, ඍ+ෘ, ඏ+ෟ, එ+ෙ කිසි විටෙක කේතනය නොකරන්න | ඉහළ | 01:INV-002, 02:VS-006 |
| G-EN-06 | ව්යඤ්ජනද බෙදිය නොහැකි ඒකක වේ. සඤ්ඤක අකුරු 5, ඥ (U+0DA5, කිසි විටෙක ජ්ඤ නොවේ) සහ ෆ ද මීට අයත්ය | ඉහළ | 01:INV-001, 03:HC-051 |
| G-EN-07 | හල් ලකුණ තනිව අකුරු නොබඳියි. C ් C හි හල් ලකුණ සැමවිට පෙනේ. බැඳුණු රූපයකට ZWJ අවශ්යය | ඉහළ | 03:HC-001 |
| G-EN-08 | ZWJ හි පිහිටීම විලාසය තීරණය කරයි: C ් ZWJ C = සංයුක්ත අකුර / යංශය / රකාරාංශය / රේඵය; C ZWJ ් C = ස්පර්ශ අකුරු (touching letters, පාලි). යුනිකේත සහ SLS 1134:2011 එකඟ වේ. 2004 SLS කෙටුම්පත ඊට වෙනස්ය | ඉහළ | 03:HC-002/003, 01:INV-005 |
| G-EN-09 | නම් කළ අනුක්රම: යංශය 0DCA 200D 0DBA · රකාරාංශය 0DCA 200D 0DBB · රේඵය 0DBB 0DCA 200D | ඉහළ | 01:INV-006, 03:HC-004 |
| G-EN-10 | සාමාන්ය පෙළෙහි ZWNJ නැත | ඉහළ | 03:HC-005 |
| G-EN-11 | සන්දර්භය අනුව වෙනස් වන අක්ෂර රූප (කොකු සහිත u, රු රූ රැ රෑ ළු, u ට පෙර ද අකුරේ වලිගය නැති වීම, හල් ලකුණේ දෙවන හැඩය) අකුරු මුහුණතට (font) අදාළ කරුණු වේ. කේතනය සාමාන්ය ව්යඤ්ජනය + ලකුණ ලෙසම පවතී | ඉහළ | 01:INV-009/010, 02:VS-011…017 |
| G-EN-12 | සැබෑ පෙළ සංග්රහවල (corpus) ZWJ නැති පෙළ (ශ්රී, අක්ෂර) හමු වන බව අපේක්ෂා කරන්න. ගැළපීම සඳහා ඒවා එකම රූපයකට ගෙන එන්න. පෙළ නිපදවීමේදී කිසි විටෙක ZWJ ඉවත් නොකරන්න | ඉහළ | 03:HC-050, 03:§10.12, 05:SP-011 |
2. ස්වර සහ ස්වර ලකුණු
| ID | නීතිය | වර්ගය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|---|
| G-VS-01 | පරායත්ත ලකුණු 17 + හල් ලකුණ. සෑම ව්යඤ්ජනයකටම රූප 19ක් ඇත: හල්, ආවේණික “අ” ස්වරය, සහ ලකුණු 17 | අනිවාර්ය | ඉහළ | 01:§2d, 02:VS-001 |
| G-VS-02 | වචනයක මුලදී ස්වතන්ත්ර ස්වර අකුර භාවිත වේ. වචනයක් තුළ ව්යඤ්ජනයකට පසු එන ස්වරය සැමවිට ලකුණකි | අනිවාර්ය | ඉහළ | 02:VS-029, 05:PH-009 |
| G-VS-03 | ස්වතන්ත්ර ස්වරයකට පසු ස්වර ලකුණක් නොයෙදේ (ඉී, ඔා). හැඩගැන්වීමේ මෘදුකාංග (shapers) සාමාන්යයෙන් මේ ගැන අනතුරු නොඅඟවයි | අනිවාර්ය | ඉහළ | 02:VS-007 |
| G-VS-04 | හල් ලකුණට පසු ස්වර ලකුණක් නොයෙදේ (ක්ා). එක් ව්යඤ්ජනයකට යෙදිය හැක්කේ එක් ස්වර ලකුණක් පමණි (කාා). ලකුණකට පසු යෙදිය හැක්කේ ං/ඃ පමණි | අනිවාර්ය | ඉහළ | 02:VS-009/010 |
| G-VS-05 | පාදකයක් නැති ලකුණක් පෙළෙහි වලංගු නොවේ | අනිවාර්ය | ඉහළ | 02:VS-008 |
| G-VS-06 | ස්වර දෙකක් එක ළඟ යෙදීම (hiatus) අර්ධ ස්වරයක් යොදා නිවැරදි කෙරේ: i/ii/e/ee/ae/aee ට පසු ය, u/uu/o/oo/aa ට පසු ව (රැය, තොප්පිය, මාලිගාව). කෙටි a ට පසු සාමාන්යයෙන් අර්ධ ස්වරයක් වෙනුවට ස්වරය ලොප් වේ (පොතේ) | නැඹුරුව | ඉහළ (අර්ධ ස්වරය), අඩු (a ට පසු) | 02:VS-030, 05:SN-010, 05:PH-009 |
| G-VS-07 | දේශීය සහ ඉංග්රීසි වචනවල කථනයේ ඇති ද්විස්වර (diphthongs) V + යි / V + වු ලෙස ලියයි (අයියා, ළමයි, කවුද, ලයිට්) | නැඹුරුව | ඉහළ | 02:VS-022, 05:PH-010 |
| G-VS-08 | ඏ ඐ ෟ (තනිව) ෳ නූතන සිංහලයේ භාවිත නොවේ. ඎ අකුර භාවිතයෙන් ඉවත් වී ඇත (එහි ලකුණ ෲ වචන කිහිපයක ඉතිරිව ඇත). ෟ ඉතිරිව ඇත්තේ ෞ/ඖ තුළ පමණි | අනිවාර්ය (සාමාන්ය ප්රකාරයේදී) | ඉහළ | 01:INV-018, 02:VS-021 |
| G-VS-09 | ස්වර දිග අර්ථය වෙනස් කරයි (phonemic). සෑම කෙටි ලකුණකටම එක් දීර්ඝ ලකුණක් ඇත: a→aa, ae→aee, i→ii, u→uu, e→ee, o→oo, ru→ruu | අනිවාර්ය | ඉහළ | 02:VS-032 |
| G-VS-10 | u/uu සමඟ ර සහ ළ අක්රමවත් අක්ෂර රූප ගනී (ae/aee සමඟ ර ද). කිසි විටෙක "දෘශ්ය" ආදේශකයක් කේතනය නොකරන්න | අනිවාර්ය | ඉහළ | 02:VS-011…013 |
| G-VS-11 | ෛ ෞ (සහ ඍ ඓ ඖ) යෙදෙන්නේ සංස්කෘත ණය වචනවල පමණි. ෘ ෲ සංස්කෘත ṛ ලිවීමට යෙදේ. අනෙක් වචනවල සහ ඉංග්රීසි ණය වචනවල ව්යඤ්ජනයකට පසු /ru, ruː/ ලියන සුලබ ක්රමයද ඒවාය (G-VS-15). ැ/ෑ (ඇ ඈ) පැහැදිලිවම සිංහලයට ආවේණිකය. සංස්කෘත වචනවල ඒවා නැති තරම්ය | නැඹුරුව | ඉහළ | 02:VS-019/020/022/034, 05:SN-012 |
| G-VS-12 | "ru" ලෙස කියවෙන ආකාර තුනකි: ර+ු, ෘ, සහ රකාරාංශය+ු. ගෘහ (නිවස) ≠ ග්රහ (ග්රහලෝකය). ක්රු/ක්රූ කේතනය කළ යුත්තේ ු/ූ සමඟය, කිසි විටෙක ැ/ෑ සමඟ නොවේ (ක්රෑර වැරදිය) | අනිවාර්ය (කේතනය), නැඹුරුව (තේරීම) | ඉහළ | 02:VS-012/016/020/034, 03:HC-024, 05:G2P-011 |
| G-VS-13 | එක් එක් ව්යඤ්ජනයට කුමන ලකුණු වලංගුද යන්න (41 × 17): data/validity.json බලන්න. මහාප්රාණ අකුරු ැ/ෑ ගන්නේ කලාතුරකිනි. ළ දීර්ඝ ලකුණු ගන්නේ කලාතුරකිනි. සඤ්ඤක අකුරුද දීර්ඝ ලකුණු ගන්නේ කලාතුරකිනි | නැඹුරුව | මධ්යම | 02:§8 |
| G-VS-14 | ්ය පොකුරුවල SLS ලැයිස්තුගත කරන්නේ a aa u uu e ee o oo ය. ්ර පොකුරුවල ලැයිස්තුව a aa ae aee i ii e ee ai o oo au ය. u uu ද යෙදේ (SLS ඒවා අතහැර ඇත; ඒවා වලංගු නමුත් දුර්ලභය, G-VS-15 බලන්න). අනෙක් සංයෝජනද කේතනය කළ හැකිය | නැඹුරුව | ඉහළ | 01:INV-018, 02:VS-016, 03:HC-020/021 |
| G-VS-15 | C + r + u/uu ට නිවැරදි අක්ෂර වින්යාස දෙකක් ඇත: C + ෘ/ෲ (කෲර, මෘදු, ගෲප්) සහ රකාරාංශය + ු/ූ (ක්රූර). දෙකම /Cru(ː)/ ලෙස කියවේ. ෘ/ෲ වඩා සුලබය: එකකට වැඩි අක්ෂර වින්යාසයකින් භාවිතයේ හමු වූ වචන 205න් 155ක වැඩිම සංඛ්යාතය ඇත්තේ එයටයි (CC-02). පෙනුමෙන් සමාන රකාරාංශය + ැ/ෑ කිසි විටෙක නිවැරදි නොවේ (G-VS-12) | විකල්ප | ඉහළ | 02:VS-020/034, 03:HC-024 |
3. හල් ලකුණ සහ ව්යඤ්ජන පොකුරු
| ID | නීතිය | වර්ගය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|---|
| G-HC-01 | පසුව ස්වරයක් නොඑන ව්යඤ්ජනයකට හල් ලකුණ යෙදේ. වචනයක අවසානය (පොතක්, මල්), වෙනත් ව්යඤ්ජනයකට පෙර තැන, සහ ද්විත්ව ව්යඤ්ජන (geminates) මීට අයත්ය | අනිවාර්ය | ඉහළ | 03:HC-010/012/013 |
| G-HC-02 | උච්චාරණය කිසි විටෙක හල් ලකුණ තීරණය නොකරයි. ආවේණික “අ” ස්වරය [a] ලෙසද [ə] ලෙසද උච්චාරණය වන්නේ යන්න ලිවීමේදී නොපෙන්වයි | අනිවාර්ය | ඉහළ | 03:HC-010/011, 05:G2P-001 |
| G-HC-03 | ද්විත්ව ව්යඤ්ජන ZWJ නැතිව C ් C ලෙස ලියයි (අම්මා, අක්කා, පත්තරය) | අනිවාර්ය | ඉහළ | 03:HC-042, 05:PH-008 |
| G-HC-04 | මෙම අකුරු කිසි විටෙක ද්විත්ව නොවේ: ඟ ඬ ඳ ඹ ඦ ඞ ෆ හ ශ (පඬි වහරේ ශ්ශ ඇත: නිශ්ශබ්ද), සහ ළ | අනිවාර්ය | ඉහළ | 03:HC-042, 05:PH-008, 04:NS-075 |
| G-HC-05 | දේශීය අක්ෂරවල (syllables) ආකාරය (C)V(C) වේ. ඒවායේ මුලදී ව්යඤ්ජන පොකුරු නැත. මුලදී පොකුරු ඇත්තේ තත්සම හෝ ඉංග්රීසි වචනවලය (ප්ර, ස්ව, ස්ටේෂන්) | නැඹුරුව | ඉහළ | 03:HC-040, 05:PH-001 |
| G-HC-06 | සඤ්ඤක ඟ ඦ ඬ ඳ ඹ කිසි විටෙක හල් ලකුණ නොගනී. එබැවින් ඒවාට පසු ්ය/්ර කිසි විටෙක නොයෙදේ. ඒවා කිසි විටෙක වචන මුලට නොඑයි | අනිවාර්ය | ඉහළ | 02:VS-025, 03:HC-014, 04:NS-031, 05:PH-003 |
| G-HC-07 | ළ කිසි විටෙක හල් ලකුණ නොගනී (ප්රකෘතියක අවසාන ළ, ළ ලෙසම පවතී; ද්විත්ව l ලියන්නේ ල්ල ලෙසය) | අනිවාර්ය | මධ්යම | 03:HC-014, 04:NS-058/075 |
| G-HC-08 | ඞ යෙදෙන්නේ ඞ් ලෙස පමණි (කණ්ඨජයකට පෙර, පාලි හෝ පඬි වහරේ වචනවල). එය කිසි විටෙක ස්වර ලකුණක් නොගනී. නූතන අක්ෂර වින්යාසය ං භාවිත කරයි | අනිවාර්ය | ඉහළ | 01:INV-018, 02:VS-023, 04:NS-040 |
| G-HC-09 | ණ කිසි විටෙක හල් ලකුණ සමඟ ප්රකෘතියක් අවසන් නොකරයි (අවසාන ව්යඤ්ජනය න් ලෙස මතු වේ). පොකුරු තුළ ණ් යෙදීම ගැටලුවක් නොවේ (ණ්ඩ) | නැඹුරුව | මධ්යම | 04:NS-058 |
| G-HC-10 | දිගු පොකුරක ව්යඤ්ජන එක් වන සෑම තැනක්ම ස්වාධීනය: ZWJ යොදන්නේ සංක්ෂිප්ත රූපයක් අවශ්ය තැන්වල පමණි (ස්ත්රී, රාෂ්ට්ර, ශාස්ත්ර) | අනිවාර්ය | ඉහළ | 03:HC-044 |
| G-HC-11 | C + ය සඳහා යංශය අනිවාර්යය: C ් ZWJ ය (වාක්ය, විද්යාව). ZWJ නැති වාක්ය පිළිගත නොහැකිය | අනිවාර්ය | ඉහළ | 03:HC-020, 05:SP-012 |
| G-HC-12 | C + ර සඳහා රකාරාංශය අනිවාර්යය: C ් ZWJ ර (ක්රම, ශ්රී, ප්රශ්නය). ම, න, ල ට පසු ර සාමාන්යයෙන් නව අක්ෂරයක් අරඹන බැවින් සාමාන්ය හල් ලකුණ ගනී (දුම්රිය, හෙන්රි). ම්ර (තාම්ර) වලංගු කේතනයක් වුවද දුර්ලභය | අනිවාර්ය | ඉහළ (නීතිය), මධ්යම (m/n/l භාවිතය) | 03:HC-021/052 |
| G-HC-13 | රේඵය විකල්ප විලාසයකි: ර් + C හෝ ර ් ZWJ + C, දෙකම නිවැරදිය (කර්ම / කර්ම) | විකල්ප | ඉහළ | 01:INV-006, 03:HC-022 |
| G-HC-14 | ර ට පසු යංශය නොයෙදේ (SLS 1134). ර ් ZWJ ය රේඵය + ය ලෙස සැලකේ. kārya සඳහා පිළිගත් අක්ෂර වින්යාස 3ක් ඇත: කාර්ය්ය (සාම්ප්රදායික), කාර්ය, කාර්ය. ර්ර භාවිතයේ හමු නොවේ | අනිවාර්ය (ර+යංශය), සැලසුම් තීරණය (kārya ලියන ආකාරය) | ඉහළ | 03:HC-033/034/054, 05:PH-012 |
| G-HC-15 | අනෙක් සංයුක්ත අකුරු (බැඳි අකුරු) විකල්ප වන අතර බොහෝ දුරට සම්භාව්ය වේ. තවමත් දැකිය හැකි ඒවා: ක්ෂ, ක්ව, න්ද, න්ධ, න්ථ, ත්ථ. සමකාලීන නොවන ඒවා: ද්ධ, ද්ව, ට්ඨ, ඤ්ච. නූතන පෙරනිමිය සාමාන්ය හල් ලකුණයි | විකල්ප | මධ්යම | 03:HC-030, 03:§9b |
| G-HC-16 | ක්ෂ සහ ක්ෂ යනු kṣ හි එකම අක්ෂර වින්යාසයේ රූප දෙකකි. දෙකම සුලබය | විකල්ප | ඉහළ | 03:HC-032, 05:SP-011 |
| G-HC-17 | ස්පර්ශ අකුරු C ZWJ ් C යෙදෙන්නේ පාලි/සම්භාව්ය පෙළවල පමණි. ඒවාට SLS Level 3 අකුරු මුහුණත් අවශ්යය. එවැනි මුහුණත් නැති තරම්ය | විකල්ප | ඉහළ | 03:HC-031/062 |
| G-HC-18 | -tva වචනවලට පිළිගත් අක්ෂර වින්යාස දෙකක් ඇත. තත්ත්වය / සත්ත්වයා ව්යාකරණානුකූල රූපයයි (සංස්කෘත tat + tva). කෙටි කළ තත්වය / සත්වයා නූතන රූපය වන අතර එයද වලංගු ලෙස පිළිගැනේ. දෙකම සුලබය. මේ ගැන නිල තීන්දුවක් නැත | විකල්ප | මධ්යම | 03:HC-043, 05:SP-008 |
4. නාසික සහ අයෝගවාහ ලකුණු
| ID | නීතිය | වර්ගය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|---|
| G-NS-01 | ං යෙදෙන්නේ ස්වරයකට, ව්යඤ්ජනයකට (+ ලකුණ) හෝ සඤ්ඤකයකට පසුවය. එය කිසි විටෙක වචන මුලට නොඑයි, හල් ලකුණකට පසු නොයෙදේ, ලකුණක් නොගනී, සහ සැමවිට තම පොකුරේ අවසානයට එයි | අනිවාර්ය | ඉහළ | 01:INV-008, 04:NS-001/002, 05:PH-004 |
| G-NS-02 | ං = [ŋ]. එය ඞ් (සහ බොහෝ විට ඤ්) වෙනුවට භාවිතයට පැමිණ ඇත: ලංකාව, මංගල, වංචාව | නැඹුරුව | මධ්යම | 04:NS-003/004 |
| G-NS-03 | ව්යඤ්ජනයකට පෙර නාසිකය (තත්සම): k/g කාණ්ඩය සහ y r l v ś ṣ s h → ං; ට/ඩ කාණ්ඩය → ණ්; ත/ද කාණ්ඩය → න්; ප/බ කාණ්ඩය → ම්; c/j කාණ්ඩය → ං (නූතන) හෝ ඤ් (පාලි). දේශීය වචන ස ට පෙර න් භාවිත කරයි (පන්සල) | නැඹුරුව | ඉහළ (මූර්ධජ, දන්තජ), මධ්යම (අනෙක්) | 04:NS-005/043/055/056, 05:SP-009 |
| G-NS-04 | sam- + ස්වරය → ම + ලකුණ (සමාගම). වචනයක් තුළ ං කිසි විටෙක ස්වරයකට පෙර නොයෙදේ | අනිවාර්ය | මධ්යම | 04:NS-006/010 |
| G-NS-05 | ඃ දුර්ලභය. එය සංස්කෘත වචනවල පමණක් යෙදෙන අතර [h] ලෙස උච්චාරණය වේ. එහි පිහිටීමේ නීති ං හි නීතිම වේ. සංස්කෘත විසර්ගය බොහෝ විට සන්ධිය හරහා ෝ / ර් / ශ් / ස් / ෂ් ලෙස මතු වේ. එය ශබ්දය පමණක් අනුව කිසි විටෙක පුරෝකථනය කළ නොහැකිය | නැඹුරුව | ඉහළ | 04:NS-020…023, 05:SN-011 |
| G-NS-06 | ඁ චන්ද්රබින්දුව නූතන සිංහලයට අයත් නොවේ. නූතන පෙළෙහි එයට තැනක් නැත | අනිවාර්ය | ඉහළ | 01:INV-011, 04:NS-025 |
| G-NS-07 | සඤ්ඤකය = ඝෝෂ ස්පර්ශයකට (voiced stop) බැඳුණු කෙටි නාසිකයකි (ඞ+ග, ඤ+ජ, ණ+ඩ, න+ද, ම+බ). එය නාසිකය + හල් + ස්පර්ශය යන පොකුරෙන් වෙනස් වේ: කඳ (ගසේ කඳ) ≠ කන්ද (පර්වතය), අඟල ≠ අංගය | අනිවාර්ය (අර්ථ භේදය) | ඉහළ | 01:INV-021, 04:NS-030/032, 05:SP-010 |
| G-NS-08 | සඤ්ඤකයද පොකුරද යන්න වචනය අනුව තීරණය වේ. තත්සම වචන කිසි විටෙක සඤ්ඤක භාවිත නොකරයි. දේශීය සහ තද්භව වචන බොහෝ විට ඒවා භාවිත කරයි. ඉංග්රීසි ණය වචන පොකුරු භාවිත කරයි (ලන්ඩන්). සමහර වචන දෙකම පිළිගනී (මග/මඟ) | නැඹුරුව | මධ්යම | 04:NS-033/034 |
| G-NS-09 | සඤ්ඤකයකට පෙර කිසිදු නාසිකයක් නොයෙදේ (අංඹ නැත, න්ඳ නැත) | අනිවාර්ය | මධ්යම | 04:NS-037 |
| G-NS-10 | සමාසවල සඤ්ඤකයක් + ව්යඤ්ජනයක් → ං හෝ හල් සහිත නාසිකයක් (ගඟ + වතුර → ගංවතුර) | නැඹුරුව | ඉහළ | 05:SN-007, 04:NS-007 |
| G-NS-11 | ඦ ප්රායෝගිකව භාවිත නොවේ. එය අකුරු මාලාවේ තබා ගන්න, නමුත් භාවිතයෙන් ඉවත් වූ අකුරක් ලෙස සලකන්න | නැඹුරුව | ඉහළ | 01:§8, 04:NS-036 |
| G-NS-12 | ඥ = සංස්කෘත jñ (ඥානය, ප්රඥාව, -ඥ ප්රත්යය). gn සැමවිටම ඥ නොවේ (අග්නි, නග්න, ලග්න) | නැඹුරුව | ඉහළ | 04:NS-042/046 |
| G-NS-13 | ny සාමාන්යයෙන් න්ය වේ (අන්ය, ශූන්ය, ධන්ය). ඤ දුර්ලභය (ඤාණ, පඤ්ච, සඤ්ඤා) | නැඹුරුව | ඉහළ | 04:NS-041/047 |
| G-NS-14 | වචන අවසානයේ ං, අවසාන ම් / න් වලින් වෙනස් වේ (දං ≠ දන්). කථන වහරේ අවසාන ං, විධිමත් ම්/න් වෙනුවට යෙදේ (මං, එහෙනං) | නැඹුරුව | මධ්යම | 04:NS-008/009 |
| G-NS-15 | කථනයේ අවසාන [ŋ] ං, න් හෝ ම් ලෙස ලිවිය හැකිය (මිනිසුන් උච්චාරණය වන්නේ minisuŋ ලෙසය). වචන අවසානයේ ඇති රෝමානුකෘත -ng අපැහැදිලිය | නැඹුරුව | මධ්යම | 03:HC-012, 05:PH-007 |
5. ශබ්ද සංයෝජන නීති (phonotactics) සහ සන්ධි
| ID | නීතිය | වර්ගය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|---|
| G-PH-01 | වචන මුලට නොඑන දේ: සඤ්ඤක අකුරු, ඞ, ං, ඃ, ඎ. ණ වචන මුලට එන්නේ ණය යන වචනයේ පමණි (පුරාතන වචන කිහිපයක්ද ඇත). ළ වචන මුලට යෙදිය හැකිය (ළමයා) | අනිවාර්ය (ණ හැර) | ඉහළ | 04:NS-031/057, 05:PH-003…006 |
| G-PH-02 | වචන අවසන් වන්නේ ස්වරයකින්, හල් සහිත ව්යඤ්ජනයකින් හෝ ං වලිනි. කිසි විටෙක සඤ්ඤකයකින් අවසන් නොවේ. ළ/ණ වචනයක් අවසන් කරන්නේ ස්වරයක් සමඟ පමණි | අනිවාර්ය | ඉහළ | 05:PH-007, 04:NS-058 |
| G-PH-03 | වචනයක් තුළ ස්වර දෙකක් එක ළඟ යෙදෙන්නේ සමාස සීමාවල සහ ස්ථාන නාමවල පමණි (ගිරිඋල්ල). රෝමානුකරණයකට එය ප්රකාශ කිරීමට පැහැදිලි වෙන් කිරීමේ සලකුණක් අවශ්යය | නැඹුරුව | ඉහළ | 05:PH-009, 02:VS-029 |
| G-PH-04 | පාසල් ව්යාකරණයේ සන්ධි වර්ග 10 සහ ස්ථිර වූ සංස්කෘත සන්ධි (dīrgha, guṇa, vṛddhi, yaṇ, visarga) පඬි වහරේ බොහෝ අක්ෂර වින්යාස පැහැදිලි කරයි (ඉත්යාදි, නිර්මාණ, දුෂ්කර, පෞද්ගලික). ඒවා එක් එක් වචනයට අයත් කරුණු මිස, නව වචනවලටද අදාළ වන (productive) නීති නොවේ | නැඹුරුව | මධ්යම | 05:SN-001…014 |
6. අක්ෂර වින්යාස භේද (එක ලෙස උච්චාරණය වන අකුරු): නීති මත නොව වචනය මත පදනම් වේ
| ID | නීතිය | වර්ගය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|---|
| G-SP-01 | මෙම කාණ්ඩවල අකුරු එක ලෙස උච්චාරණය වේ: {ක ඛ} {ග ඝ} {ච ඡ} {ජ ඣ} {ට ඨ} {ඩ ඪ} {ත ථ} {ද ධ} {ප ඵ} {බ භ} {න ණ} {ල ළ} {ස ශ ෂ} {ඤ ඥ}. ශබ්දයෙන් අකුර තෝරා ගත නොහැකිය. පෙළ සංග්රහය අනුව පෙළගැස්වූ ශබ්දකෝෂයක් (lexicon) එය කළ යුතුය (එක් අධ්යයනයක් පෙළගැස්වීම පමණක් භාවිතයෙන් 82% ක නිරවද්යතාවක් ලබා ගත්තේය) | නැඹුරුව | ඉහළ | 01:INV-023, 05:G2P-010, 05:SP-003…006 |
| G-SP-02 | ණ: නාමවල ර / ෂ / ඍ ට පසු, ඒ අතරට දන්තජයක්, තාලුජයක්, මූර්ධජයක්, ල, ශ හෝ ස නොඑන්නේ නම් (ṇatva නීතිය); ට/ඩ ට පෙර; ගෞරව වාචී පදවල (-ආණ, -අණි); අතීත/කර්ම කාරක රූපවල (-ඉණි, -උණු) | නැඹුරුව | ඉහළ | 04:NS-051…060, 05:SP-003 |
| G-SP-03 | න: ර ට පසු වුවද දේශීය ක්රියාපදවල (මරන ≠ මරණ); දන්තජ සහ ස ට පෙර; ස/ශ ට පසු; ද්විත්ව ව්යඤ්ජනවල; සමාස සීමාවල | නැඹුරුව | ඉහළ | 04:NS-056/061…063, 05:SP-003 |
| G-SP-04 | ළ: ර-ධාතුවල අතීත රූපවල (කර → කළ); පිළි- උපසර්ගයේ; "කුඩා / ළදරු" අර්ථ ඇති වචනවල (ළමා); l…l නාමයක පළමු l ලෙස; සඤ්ඤකයකට පෙර (විශ්වාසය මධ්යම); පාලි/සංස්කෘත මූර්ධජවලින් පැවත එන තැන්වල (පොළොව) | නැඹුරුව | ඉහළ | 04:NS-071…079, 05:SP-004 |
| G-SP-05 | ස / ශ / ෂ: දේශීය වචන ස භාවිත කරයි. ශ තාලුජ සමඟ, ව ට පෙර, ශ්ර තුළ, සහ ඌෂ්ම (sibilants) දෙකක පළමුවැන්න ලෙස යෙදේ. ෂ මූර්ධජවලට පෙර, ක්ෂ තුළ, a/aa හැර අනෙක් ස්වරවලට පසු k/p ට පෙර (ruki), සහ -ඉෂ්ඨ තුළ යෙදේ. ස දන්තජවලට පෙර යෙදේ | නැඹුරුව | ඉහළ | 04:NS-080…087, 05:SP-005 |
| G-SP-06 | මහාප්රාණ අකුරු සඳහා නීතියක් නැත. ඒවා වචනයෙන් වචනය ඉගෙන ගත යුතුය. සමහර වචනවලට පිළිගත් විකල්ප ඇත (කථා/කතා) | නැඹුරුව | ඉහළ | 05:SP-006 |
| G-SP-07 | ස්වර දිග සම්බන්ධ වැරදි වඩාත්ම සුලබය. ක්රියා නාම ප්රත්යය දීර්ඝ -ීම වේ (කිරීම) | නැඹුරුව | ඉහළ | 02:VS-033, 05:SP-007 |
| G-SP-08 | අර්ථයෙන් වෙනස් යුගල වෙන් වෙන්ව තිබිය යුතුය: කණ/කන, වණ/වන, කල/කළ, පල/පළ, මරණ/මරන | නැඹුරුව | ඉහළ | 04:§6, 05:SP-003/004 |
7. සිංහල ලතින් අකුරින් ලිවීම (අවිධිමත් රෝමානුකරණය)
මෙම සොයාගැනීම් සිංහල මව් භාෂාව කතා කරන්නන්ගේ රෝමානුකරණ ඇතුළත් Dakshina පෙළ සංග්රහයෙන් මැන ඇත. 06-romanization.md බලන්න. මෙම ගොනුවේ ඇති සෑම පෙළ සංග්රහ සංඛ්යාවක්ම tools/corpus_counts.py මගින් නැවත ගණනය කළ හැක (reports/corpus-counts.md).
| ID | සොයාගැනීම | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|
| G-TY-01 | th = ත සහ t = ට යන්න සියල්ලන්ම පාහේ භාවිත කරයි (93–99%) | ඉහළ | 06:RS-001 |
| G-TY-02 | ද d ලෙස ලියයි (99%). ධ dh ලෙස ලියයි | ඉහළ | 06:RS-002/003 |
| G-TY-03 | ී අවස්ථාවලින් 38% ක ee ලෙසද, ූ 22% ක oo ලෙසද ලියයි | ඉහළ | 06:RS-006/007 |
| G-TY-04 | ස්වර දිග සලකුණු කරන්නේ කලාතුරකිනි: ා අවස්ථාවලින් 97% ක a ලෙස ලියයි | ඉහළ | 06:RS-009 |
| G-TY-05 | අවිධිමත් කතාබහේදී ස්වර අතහැරේ (nthi, mta). ඒවා නැවත ලබා ගත හැක්කේ ශබ්දකෝෂයකින් හෝ ආසන්න ගැළපීමකින් (fuzzy matching) පමණි | ඉහළ | 06:RS-010 |
| G-TY-06 | ඳ ඹ ඟ nd mb ng ලෙස ලියයි (ඳ = nd 91%). ං n ලෙස ලියයි (91%) | ඉහළ | 06:RS-012/014 |
| G-TY-07 | ඇ e හෝ a ලෙස ලියයි. ae ලෙස ලියන්නේ කලාතුරකිනි | ඉහළ | 06:RS-008 |
| G-TY-08 | අවිධිමත් ලිවීමේදී මූර්ධජ ණ / ළ කිසි විටෙක වෙන් කර නොදක්වයි (සැමවිට n, l) | ඉහළ | 06:RS-025 |
| G-TY-09 | අවධාරණය නොවන [ə] ස්වරය (schwa) a ලෙස ලියයි (සමහර විට e): karanawa / keranawa = කරනවා. නියමිත අනුපිළිවෙළට යොදන schwa නීති (98% නිවැරදි) එය පුරෝකථනය කරයි | ඉහළ | 05:G2P-001…009, 03:HC-011 |
| G-TY-10 | w සහ v දෙකම ව නියෝජනය කරයි. බොහෝ දෙනා w තෝරා ගනී (72%) | ඉහළ | 06:RS-011 |
8. ණය වචන සම්මුති
| ID | නීතිය | විශ්වාසය | මූලාශ්ර |
|---|---|---|---|
| G-LW-01 | f → ෆ (පැරණි ණය වචනවල ප: කෝපි) | ඉහළ | 05:LW-001, 01:INV-022 |
| G-LW-02 | v/w → ව; z → ස; ʒ → ජ; θ → ත | මධ්යම | 05:LW-002/006/008 |
| G-LW-03 | æ → ඇ හෝ ඈ (ඒකාක්ෂර වචන ඈ දෙසට නැඹුරු වේ: ෆෑන්, බෑග්; බහු අක්ෂර වචන ඇ ගනී: බැංකුව). දෙකම යෙදේ | මධ්යම | 05:LW-003 |
| G-LW-04 | ɒ → ඔ; əʊ / ɔː → ඕ; ඉංග්රීසි schwa සහ -er → අ / -අර් | ඉහළ | 05:LW-004/005 |
| G-LW-05 | sh → ෂ (ජනප්රිය), සමහර විට ශ; x → ක්ස් (කිසි විටෙක ක්ෂ නොවේ); -ng → ං (ඉංග්රීසි) | මධ්යම | 05:LW-007/009/012 |
| G-LW-06 | ණය වචන අවසාන හල් ලකුණ තබා ගනී (බස්, ෆෝන්). සාහිත්ය රූප -ය/-ව එක් කරයි (බෝලය, නෝට්ටුව) | ඉහළ | 05:LW-011 |
9. මෙම නීති මත ගොඩනැගූ ශබ්දානුසාරී රෝමානුකරණයක්
07-phonetic-romanization.md ශබ්දානුසාරී රෝමානුකරණයක් (සම්මුති R-01…R-15) නිර්වචනය කරයි. එය ඉහත සෑම නීතියක්ම කේතනය කරයි: නීති අවසර දෙන අකුරු රූප 791 ම එයින් නිපදවිය හැකිය. සියලු අවස්ථා පරීක්ෂා කළ විට, එය කිසි විටෙක තහනම් අනුක්රමයක් නොනිපදවයි.
10. විසඳා නැති ප්රශ්න සහ ගැටුම්
| # | විසඳා නැති ප්රශ්නය | බලපාන තැන |
|---|---|---|
| 1 | NIE පෙළපොත්, SLS 1134:2004/2011 හි අවසාන පිටපත් සහ Sinhala Lekhana Rīthiya (1989) පරිශීලනය කර නැත. පාසල් ව්යාකරණ නීති පදනම් වන්නේ එකිනෙකට එකඟ වන ද්විතීයික මූලාශ්ර මතය | G-SP-*, G-HC-07, හෝඩියේ අකුරු ගණන් |
| 2 | 41 × 17 වලංගුභාව වගුව සංශ්ලේෂණයකි, පෙළ සංග්රහයකින් ගණන් කළ එකක් නොවේ. පෙළ සංග්රහයකට එරෙහිව පරීක්ෂා කර ඇත්තේ ෘ / ෲ තීරු පමණි (02:VS-035) | G-VS-13 / validity.json |
| 3 | ස්පර්ශ අකුරු සහ රේඵය සමඟ යංශය යන දෙකෙහි කේතන SLS කෙටුම්පත් අතර වෙනස් විය | G-EN-08, G-HC-14 |
| 4 | ම්ර / න්ර / ල්ර කිසිදු සිංහල මූලාශ්රයක භාවිතයේ හමු නොවේ. සාමාන්ය ම්ර / න්ර භාවිතයේ හමු වේ (03:HC-052) | G-HC-12, R-07 |
| 5 | ය ර ල ව ශ ස හ ට පෙර ං සැබවින්ම උච්චාරණය වන ආකාරය | G-NS-02/03 |
නිර්දේශිත ඊළඟ පියවර: සිංහල පෙළ සංග්රහයක (Wikipedia dump හෝ UCSC 10M) ව්යඤ්ජනය + ලකුණ සහ පොකුරු යුගල (bigrams) ගණන් කරන්න. එවිට validity.json සංශ්ලේෂණයක සිට මනින ලද දත්ත බවට පත් වේ. එමෙන්ම අපැහැදිලිතාව විසඳන ස්තරයට (disambiguation layer) වඩා හොඳ ශබ්දකෝෂයක් ලැබේ.