ಎಐ ಎನ್ನುವ ಮಾಯಾವಿ: ಸುಳ್ಳನ್ನೂ ಸತ್ಯವಾಗಿಸುವ 'ಹ್ಯಾಲುಸಿನೇಷನ್' ಜಾಲ!
ಟೋಕನ್, ಮೆಮೊರಿ ಮತ್ತು ಕಟ್ಟುಕಥೆ: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಕಣ್ಣಿಗೆ ಕಾಣದ ಮಿತಿಗಳು
ಡಾ. ರಮೇಶ್ ನಿಂಬೆಮರದಳ್ಳಿ
“AI - ಮನುಕುಲದ ಮಹಾಯಾನ” - ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಕನ್ನಡದಲ್ಲಿ ಸರಳವಾಗಿ ಕಟ್ಟಿಕೊಡುವ ಸಮಗ್ರ ಕೃತಿ ಶೀಘ್ರದಲ್ಲೇ ನಿಮ್ಮ ಕೈಗೆ...
ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ ಎನ್ನುವುದು ಇಪ್ಪತ್ತೊಂದನೇ ಶತಮಾನದ ‘ಸರ್ವಜ್ಞ’ನಂತೆ ನಮ್ಮ ಮುಂದೆ ಬಂದು ನಿಂತಿದೆ. ನಾವೇನು ಕೇಳಿದರೂ ಕ್ಷಣಮಾತ್ರದಲ್ಲಿ ಉತ್ತರಿಸುವ ಅದರ ವೇಗ ಮತ್ತು ಭಾಷಾ ಚಾತುರ್ಯವನ್ನು ಕಂಡು ಇಡೀ ಜಗತ್ತೇ ಬೆರಗಾಗಿದೆ. ಆದರೆ, ಜಗತ್ತಿನ ಅತ್ಯಂತ ಬುದ್ಧಿವಂತ ಮನುಷ್ಯನಿಗೂ ಕೆಲವು ಮಿತಿಗಳು ಮತ್ತು ವಿಚಿತ್ರ ಸ್ವಭಾವಗಳಿರುವಂತೆ, ಈ ಮಾಂತ್ರಿಕ ಎಐ ಮಾದರಿಗಳಿಗೂ ಕಣ್ಣಿಗೆ ಕಾಣದ ತಾಂತ್ರಿಕ ಚೌಕಟ್ಟುಗಳಿವೆ. ಈ ಚೌಕಟ್ಟುಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳದೆ ಎಐ ಜಗತ್ತಿಗೆ ಪ್ರವೇಶಿಸಿದರೆ, ಅದು ನೀಡುವ ಸುಳ್ಳುಗಳನ್ನೇ ಸತ್ಯವೆಂದು ನಂಬಿ ನಾವು ಮೋಸ ಹೋಗುವ ಅಪಾಯವಿರುತ್ತದೆ.
ಎಐ ಎನ್ನುವುದು ಕೇವಲ ಮನುಷ್ಯನಂತೆ ಯೋಚಿಸುವ ಯಂತ್ರವಲ್ಲ; ಅದೊಂದು ನಿಶ್ಚಿತ ಗಣಿತದ ಸೂತ್ರಗಳ ಮೇಲೆ ನಡೆಯುವ ವ್ಯವಸ್ಥೆ. ನಾವು ಎಐ ತಂತ್ರಜ್ಞಾನವನ್ನು ಕೇವಲ ಕುತೂಹಲಕ್ಕಾಗಿ ಬಳಸದೆ, ಅದರಿಂದ ಹಣ, ಸಮಯ ಮತ್ತು ಶ್ರಮವನ್ನು ಜಾಣ್ಮೆಯಿಂದ ಉಳಿಸಿಕೊಳ್ಳಬೇಕಾದರೆ ಅದರ ಆಂತರಿಕ ಭಾಷೆಯಾದ ‘ಟೋಕನ್’, ತಾತ್ಕಾಲಿಕ ನೆನಪಿನ ಶಕ್ತಿಯಾದ ‘ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೊ’ ಮತ್ತು ಅದು ಹೆಣೆಯುವ ಸುಂದರ ಸುಳ್ಳಿನ ಜಾಲವಾದ ‘ಹ್ಯಾಲುಸಿನೇಷನ್’ ಎಂಬ ಪರಿಕಲ್ಪನೆಗಳನ್ನು ಸರಳವಾಗಿ ಅರಿಯಬೇಕಿದೆ. ವಿಶೇಷವಾಗಿ ಇಂಗ್ಲಿಷ್ಗೆ ಹೋಲಿಸಿದರೆ ನಮ್ಮ ಕನ್ನಡದಂತಹ ಶ್ರೀಮಂತ ಭಾರತೀಯ ಭಾಷೆಗಳಲ್ಲಿ ಎಐ ಹೇಗೆ ವಿಭಿನ್ನವಾಗಿ ವರ್ತಿಸುತ್ತದೆ ಎಂಬ ಆಸಕ್ತಿದಾಯಕ ಸಂಗತಿಗಳನ್ನು ತಾಂತ್ರಿಕ ಸತ್ಯಗಳ ಬೆಳಕಿನಲ್ಲಿ ಈ ಭಾಗದಲ್ಲಿ ವಿವರಿಸಲಾಗಿದೆ.
ಟೋಕನ್: ಎಐ ಭಾಷೆಯ ಅತಿ ಚಿಕ್ಕ ಘಟಕ
ನಾವು ಬರೆಯುವ ಪದಗಳನ್ನು ಎಐ ಮನುಷ್ಯರಂತೆ ನೇರವಾಗಿ ಅಥವಾ ಇಡೀ ವಾಕ್ಯವನ್ನು ಇಡಿಯಾಗಿ ಗ್ರಹಿಸುವುದಿಲ್ಲ. ಅದು ಭಾಷೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಇಡೀ ವಾಕ್ಯವನ್ನು ಸಣ್ಣ ಸಣ್ಣ ತುಣುಕುಗಳಾಗಿ ಒಡೆಯುತ್ತದೆ. ಈ ಪ್ರತಿಯೊಂದು ತುಣುಕನ್ನು ‘ಟೋಕನ್’ (Token) ಎನ್ನಲಾಗುತ್ತದೆ. ಹೀಗೆ ಅಕ್ಷರ, ಪದ, ಪದಗುಚ್ಛ ಅಥವಾ ವಾಕ್ಯಗಳನ್ನು ಟೋಕನ್ಗಳಾಗಿ ವಿಂಗಡಿಸಿ ಲೆಕ್ಕ ಹಾಕುವ ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ‘ಟೋಕನೈಸರ್’ (Tokenizer) ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಎಐ ಮಾದರಿ ಒಂದರ ಮಿತಿ ಮತ್ತು ಸಾಮರ್ಥ್ಯವನ್ನು ನಿರ್ಧರಿಸುವುದೇ ಈ ಟೋಕನ್.
ಟೋಕನ್ಗಳನ್ನು ಆಯಾ ಭಾಷೆಯ ಲಿಪಿ, ವಾಕ್ಯ ರಚನೆ ಮತ್ತು ವ್ಯಾಕರಣ ನಿಯಮಗಳ ಅನುಸಾರ ಲೆಕ್ಕ ಹಾಕಲಾಗುತ್ತದೆ. ಹೀಗಾಗಿ ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಕನ್ನಡ ಸೇರಿದಂತೆ ಇತರೆ ಭಾರತೀಯ ಭಾಷೆಗಳ ಟೋಕನ್ ಲೆಕ್ಕಾಚಾರ ಸಂಪೂರ್ಣ ಭಿನ್ನವಾಗಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, “ಕನ್ನಡ ನಮ್ಮ ಹೆಮ್ಮೆಯ ಮಾತೃ ಭಾಷೆ” ಎಂಬ ವಾಕ್ಯವನ್ನು ಎಐ ಗ್ರಹಿಸುವಾಗ ಪದಗಳನ್ನು ಅದರ ಧಾತು (ಕ್ರಿಯಾಪದದ ಮೂಲ ರೂಪ) ಮತ್ತು ಪ್ರತ್ಯಯ, ವ್ಯಾಕರಣ ಚಿಹ್ನೆಗಳ ಆಧಾರದ ಮೇಲೆ ಪ್ರತ್ಯೇಕವಾಗಿ ಲೆಕ್ಕ ಹಾಕುತ್ತದೆ. ಇಲ್ಲಿ ಇಡೀ ವಾಕ್ಯವನ್ನು ಎಐ ‘ಕನ್ನಡ + ನಮ್ಮ + ಹೆಮ್ಮೆ + ಯ + ಮಾತೃ + ಭಾಷೆ’ - ಹೀಗೆ ವಿವಿಧ ಟೋಕನ್ಗಳಾಗಿ ವಿಂಗಡಿಸಿಕೊಳ್ಳುತ್ತದೆ. ನಂತರ ಈ ಟೋಕನ್ಗಳನ್ನು ವ್ಯಾಕರಣಬದ್ಧವಾಗಿ ಜೋಡಿಸಿ ಇಡೀ ವಾಕ್ಯದ ಅರ್ಥವನ್ನು ಗ್ರಹಿಸುತ್ತದೆ.
ಭಾರತೀಯ ಭಾಷೆಗಳಲ್ಲಿ 400% ಟೋಕನ್ ಹೆಚ್ಚು
ಕೇವಲ ಪದಗಳು ಮಾತ್ರವಲ್ಲದೆ, ವಾಕ್ಯದಲ್ಲಿ ಬರುವ ಸಂಖ್ಯೆಗಳು, ವ್ಯಾಕರಣ ಚಿಹ್ನೆಗಳೂ ಸಹ ಪ್ರತ್ಯೇಕ ಟೋಕನ್ಗಳಾಗಿ ಲೆಕ್ಕಕ್ಕೆ ಬರುತ್ತವೆ. ಎಲ್ಲಕ್ಕಿಂತ ಮುಖ್ಯವಾಗಿ, ಕನ್ನಡದ ಒತ್ತಕ್ಷರಗಳನ್ನು ಜಾಗತಿಕ ಎಐ ಮಾದರಿಗಳು ಗ್ರಹಿಸುವಾಗ ಅವುಗಳ ಸಂಕೀರ್ಣ ಯುನಿಕೋಡ್ ವಿನ್ಯಾಸದಿಂದಾಗಿ ಒಂದೊಂದು ಒತ್ತಕ್ಷರಕ್ಕೂ 2 ರಿಂದ 3 ಹೆಚ್ಚುವರಿ ಟೋಕನ್ಗಳು ವ್ಯಯವಾಗುತ್ತವೆ.
ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ನಮ್ಮ ಭಾಷೆಯಲ್ಲಿರುವಂತೆ ಪದದ ಜೊತೆಗೇ ಅಂಟಿಕೊಳ್ಳುವ ಹೆಚ್ಚಿನ ಪ್ರತ್ಯಯಗಳಿಲ್ಲ. ಜೊತೆಗೆ ಜಾಗತಿಕ ಎಐ ಮಾದರಿಗಳನ್ನು ಹೆಚ್ಚಾಗಿ ಇಂಗ್ಲಿಷ್ ಭಾಷೆಯ ಡೇಟಾ ಬಳಸಿ ತರಬೇತಿಗೊಳಿಸಿರುವುದರಿಂದ ಆ ಭಾಷೆ ಕಡಿಮೆ ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ. ಈ ಕಾರಣದಿಂದಾಗಿ, ಇಂಗ್ಲಿಷ್ಗೆ ಹೋಲಿಸಿದರೆ ಕನ್ನಡ ಸೇರಿದಂತೆ ಬಹುತೇಕ ಭಾರತೀಯ ಭಾಷೆಗಳು ಸುಮಾರು 2 ರಿಂದ 4 ಪಟ್ಟು (ಎಂದರೆ 200% ರಿಂದ 400%) ಹೆಚ್ಚು ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಅಂದರೆ ಇಂಗ್ಲಿಷ್ನ ಒಂದು ವಾಕ್ಯಕ್ಕೆ 5 ಟೋಕನ್ ಸಾಕಾದರೆ, ಅದೇ ಅರ್ಥದ ಕನ್ನಡ ವಾಕ್ಯಕ್ಕೆ 15 ರಿಂದ 20 ಟೋಕನ್ಗಳು ಬೇಕಾಗಬಹುದು. ಇದರಿಂದಾಗಿ ಭಾರತೀಯ ಭಾಷೆಗಳಲ್ಲಿ ಎಐ ಬಳಸುವುದು ಇಂಗ್ಲಿಷ್ಗಿಂತ ಹೆಚ್ಚು ದುಬಾರಿಯಲ್ಲದೆ ಪ್ರಕ್ರಿಯೆಯೂ ನಿಧಾನವಾಗುತ್ತದೆ.
ಸಮಸ್ಯೆ ಭಾಷೆಯ ಸಂಕೀರ್ಣತೆಯಲ್ಲಿಲ್ಲ
ಇದು ಖಂಡಿತವಾಗಿಯೂ ಕನ್ನಡ ಅಥವಾ ಭಾರತೀಯ ಭಾಷೆಗಳ ಸಂಕೀರ್ಣತೆಯ ಸಮಸ್ಯೆಯಲ್ಲ. ಬದಲಿಗೆ, ಭಾಷೆಯನ್ನು ಒಡೆದು ನೋಡುವ ವಿದೇಶಿ ಟೋಕನೈಸರ್ಗಳ ತಾಂತ್ರಿಕ ಮಿತಿಯಷ್ಟೇ. ಪ್ರಸ್ತುತ ಬಳಕೆಯಲ್ಲಿರುವ ಜಾಗತಿಕ ಟೋಕನೈಸರ್ಗಳನ್ನು ಇಂಗ್ಲಿಷ್ ಕೇಂದ್ರಿತವಾಗಿ ರೂಪಿಸಿರುವುದರಿಂದ ಅವುಗಳಿಗೆ ಕನ್ನಡದ ವೈಜ್ಞಾನಿಕ ಲಿಪಿ ವಿನ್ಯಾಸ ಅರ್ಥವಾಗದೆ ಅಕ್ಷರಗಳನ್ನು ಬೈಟ್ಗಳಾಗಿ ಒಡೆದು ಅತಿ ಹೆಚ್ಚು ಟೋಕನ್ಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತವೆ.
ನಮ್ಮ ಭಾಷೆಯ ರಚನೆ ಮತ್ತು ವ್ಯಾಕರಣಕ್ಕೆ ಹೊಂದುವಂತಹ ಸ್ವದೇಶಿ ಟೋಕನೈಸರ್ಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಿದರೆ ಟೋಕನ್ಗಳ ಸಂಖ್ಯೆಯನ್ನು ಭಾರಿ ಪ್ರಮಾಣದಲ್ಲಿ ಕಡಿಮೆ ಮಾಡಬಹುದು. ಈಗಾಗಲೇ ಭಾರತದಲ್ಲೇ ಅಭಿವೃದ್ಧಿಯಾಗಿರುವ ದೇಶೀಯ ಎಐ ಮಾದರಿಗಳು (ಉದಾಹರಣೆಗೆ Sarvam-1 ಅಥವಾ ಕ್ರುತ್ರಿಮ್ Krutrim) ಭಾರತೀಯ ಭಾಷೆಗಳಿಗಾಗಿಯೇ ಪ್ರತ್ಯೇಕ ಟೋಕನೈಸರ್ಗಳನ್ನು ರೂಪಿಸುತ್ತಿವೆ. ಇವು ಕನ್ನಡದ ಅಕ್ಷರ ವಿನ್ಯಾಸಕ್ಕೆ ತಕ್ಕಂತೆ ಕೆಲಸ ಮಾಡುವುದರಿಂದ ಮುಂದಿನ ದಿನಗಳಲ್ಲಿ ಟೋಕನ್ಗಳ ಸಂಖ್ಯೆ ಹಾಗೂ ವೆಚ್ಚ ಗಣನೀಯವಾಗಿ ಕಡಿಮೆಯಾಗಲಿದ್ದು, ಕನ್ನಡದಲ್ಲಿ ಎಐ ಬಳಕೆ ಸುಲಭ ಮತ್ತು ವೇಗವಾಗಲಿದೆ.
ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ: ಎಐನ ನೆನಪಿನ ವ್ಯಾಪ್ತಿ
ಎಐ ಜೊತೆ ನಾವು ನಡೆಸುವ ಇಡೀ ಚರ್ಚೆಯನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವ ಅದರ ಸಾಮರ್ಥ್ಯವನ್ನೇ ತಾಂತ್ರಿಕ ಭಾಷೆಯಲ್ಲಿ ‘ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ’ (Context Window) ಎನ್ನಲಾಗುತ್ತದೆ. ಇದನ್ನು ಒಬ್ಬ ಮನುಷ್ಯನ ತಾತ್ಕಾಲಿಕ ನೆನಪಿನ ಶಕ್ತಿಗೆ ಹೋಲಿಸಬಹುದು. ಒಬ್ಬ ಮನುಷ್ಯ ಒಮ್ಮೆಗೆ ಎಲ್ಲವನ್ನೂ ನೆನಪಿನಲ್ಲಿಡಲು ಸಾಧ್ಯವಿಲ್ಲ. ಕೆಲವು ವಿಚಾರ ಉಳಿದು ಮತ್ತಷ್ಟು ಮರೆಯಾಗುತ್ತದೆ. ಹಾಗೆಯೇ ಎಐ ಕೂಡ ಒಂದು ಚಾಟ್ನಲ್ಲಿ ಏಕಕಾಲದಲ್ಲಿ ಎಷ್ಟು ಮಾಹಿತಿಯನ್ನು ನೆನಪಿನಲ್ಲಿಟ್ಟುಕೊಂಡು ಸಂಭಾಷಣೆ ನಡೆಸಬಲ್ಲದು ಎಂಬುದನ್ನು ಈ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ನಿರ್ಧರಿಸುತ್ತದೆ.
ನೆನಪಿನ ಶಕ್ತಿಯ ಮಿತಿ ಇರುವುದು ಪದಗಳಲ್ಲಲ್ಲ, ಟೋಕನ್ಗಳಲ್ಲಿ. ಎಐ ತನ್ನ ನೆನಪಿನ ಶಕ್ತಿಯನ್ನು ನಾವಾಡುವ ಪದಗಳ ಆಧಾರದ ಮೇಲೆ ಲೆಕ್ಕ ಹಾಕುವುದಿಲ್ಲ; ಬದಲಿಗೆ ಟೋಕನ್ಗಳ ಆಧಾರದ ಮೇಲೆ ಅಳೆಯುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಎಐ ಮಾದರಿಯ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಸಾಮರ್ಥ್ಯ 10,000 ಟೋಕನ್ಗಳು ಎಂದಿಟ್ಟುಕೊಳ್ಳೋಣ. ಇದರರ್ಥ, ಒಂದು ಚಾಟ್ ವಿಂಡೋದಲ್ಲಿ ನೀವು ಕೇಳುವ ಪ್ರಶ್ನೆಗಳು, ಎಐ ಆಲೋಚಿಸುವ ಪ್ರಕ್ರಿಯೆ ಮತ್ತು ಅಂತಿಮವಾಗಿ ನೀಡುವ ಉತ್ತರಗಳು ಎಲ್ಲವೂ ಸೇರಿ ಒಟ್ಟು ಗರಿಷ್ಠ 10,000 ಟೋಕನ್ಗಳ ಮಿತಿಯೊಳಗೆ ಇರಬೇಕು. ಈ ಮಿತಿ ದಾಟಿದ ತಕ್ಷಣ ಎಐನ ಮೆಮೊರಿ ತುಂಬಿಹೋಗುತ್ತದೆ. ಬಳಿಕ ಆ ಚಾಟ್ನಲ್ಲಿ ಮುಂದುವರಿಯುವುದು ಪರಿಣಾಮಕಾರಿಯಲ್ಲ. ಹೊಸ ಚಾಟ್ ವಿಂಡೋ ತೆರೆದಾಗ ಎಐಗೆ ಹಳೆಯ ಚರ್ಚೆಗಳು ನೆನಪಿರುವುದಿಲ್ಲ, ಎಲ್ಲವನ್ನೂ ಹೊಸದಾಗಿಯೇ ಶುರು ಮಾಡಬೇಕು. ಕೆಲವು ಎಐ ಮಾದರಿಗಳು ನಮ್ಮ ಎಲ್ಲಾ ಚಾಟ್ ಇತಿಹಾಸವನ್ನೂ ನೆನಪನಲ್ಲಿಟ್ಟುಕೊಳ್ಳುತ್ತವೆ. ಆದರೆ ಪ್ರತಿ ಬಾರಿಯೂ ಅವುಗಳನ್ನು ಪರಿಶೀಲಿಸಲು ಟೋಕನ್ ವ್ಯಯಿಸುತ್ತವೆ.
ವಿದೇಶಿ ಟೋಕನೈಸರ್ಗಳ ಮಿತಿ ಮತ್ತು ಪರಿಣಾಮ
ವಿದೇಶಿ ಟೋಕನೈಸರ್ಗಳ ಮಿತಿಯಿಂದಾಗಿ ಕನ್ನಡವು ಇಂಗ್ಲಿಷ್ಗೆ ಹೋಲಿಸಿದರೆ 2 ರಿಂದ 4 ಪಟ್ಟು ಹೆಚ್ಚು ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ. ಇದು ಎಐನ ನೆನಪಿನ ಶಕ್ತಿಯ ಮೇಲೆ ನೇರ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. 10,000 ಟೋಕನ್ಗಳ ಮಿತಿಯಲ್ಲಿ ಇಂಗ್ಲಿಷ್ನ ಸುಮಾರು 7,500 ಪದಗಳನ್ನು (ಸುಮಾರು 15 ರಿಂದ 18 ಪುಟಗಳಷ್ಟು ಸುದೀರ್ಘ ಚರ್ಚೆ) ಎಐ ಸುಲಭವಾಗಿ ನೆನಪಿಟ್ಟುಕೊಳ್ಳಬಲ್ಲದು. ಆದರೆ, ಅದೇ 10,000 ಟೋಕನ್ಗಳ ಮಿತಿಯಲ್ಲಿ ಕನ್ನಡದ ಕೇವಲ 1,850 ರಿಂದ 2,500 ಪದಗಳನ್ನು ಮಾತ್ರ ಎಐ ನೆನಪಿನಲ್ಲಿ ಇಟ್ಟುಕೊಳ್ಳಲು ಸಾಧ್ಯ. ಅಂದರೆ ಕೇವಲ 4 ರಿಂದ 5 ಪುಟಗಳಷ್ಟು ಚರ್ಚೆ ಮುಗಿಯುವಷ್ಟರಲ್ಲೇ ಕನ್ನಡದಲ್ಲಿ ಎಐನ ಜ್ಞಾಪಕ ಶಕ್ತಿ ಸಂಪೂರ್ಣವಾಗಿ ಕುಸಿದುಬಿಡುತ್ತದೆ.
ಮೆಮೊರಿ ತುಂಬಿದರೆ ಏನಾಗುತ್ತದೆ?
ಕನ್ನಡದಲ್ಲಿ ಟೋಕನ್ಗಳು ಬೇಗನೆ ಖಾಲಿಯಾಗುವುದರಿಂದ, ಎಐ ತನ್ನ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಮಿತಿಯನ್ನು ತುಂಬಾ ವೇಗವಾಗಿ ತಲುಪುತ್ತದೆ. ಈ ಮಿತಿ ಮೀರಿದ ತಕ್ಷಣ, ತುಂಬಿದ ಬಕೆಟ್ಗೆ ನೀರು ಸುರಿದಾಗ ಅದು ಹೊರಚೆಲ್ಲುವಂತೆ, ಹಳೆಯ ವಿವರಗಳನ್ನು ಎಐ ಖಾಲಿ ಮಾಡುತ್ತಾ ಹೋಗುತ್ತದೆ. ಎಂದರೆ ಚಾಟ್ನ ಆರಂಭಿಕ ಮಾತುಕತೆಯನ್ನು ಮರೆಯುತ್ತಾ ಹೋಗುತ್ತದೆ. ಸನ್ನಿವೇಶದ ಅರಿವಿಲ್ಲದೆ ಎಐ ತಪ್ಪು ಉತ್ತರಗಳನ್ನು ಸರಿಯೆಂದೇ ಭಾವಿಸಿ ನೀಡಲು ಆರಂಭಿಸುತ್ತದೆ. ಇದನ್ನು ತಾಂತ್ರಿಕವಾಗಿ ‘ಎಐ ಹ್ಯಾಲುಸಿನೇಷನ್’ ಎನ್ನಲಾಗುತ್ತದೆ.
ಹ್ಯಾಲುಸಿನೇಷನ್: ಎಐ ಹೆಣೆಯುವ ‘ಕಟ್ಟುಕಥೆ’
ಎಐ ತಂತ್ರಜ್ಞಾನದಲ್ಲಿ ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ಮಿತಿ ಮತ್ತು ತಮಾಷೆಯ ದೋಷವೆಂದರೆ ‘ಹ್ಯಾಲುಸಿನೇಷನ್’ (Hallucination). ಸರಳವಾಗಿ ಹೇಳಬೇಕೆಂದರೆ, ಎಐ ಮಾದರಿಗಳಿಗೆ ‘ನನಗೆ ಗೊತ್ತಿಲ್ಲ’ ಎಂದು ಒಪ್ಪಿಕೊಳ್ಳುವ ನಮ್ರತೆ ಇರುವುದಿಲ್ಲ. ತನಗೆ ತಿಳಿಯದ ವಿಷಯ ಬಂದಾಗ, ಅದು ತನ್ನ ಕಲ್ಪನಾ ಶಕ್ತಿಯನ್ನು ಬಳಸಿ, ಸುಳ್ಳುಗಳನ್ನೇ ಸತ್ಯದಂತೆ ಪೋಣಿಸಿ ಉತ್ತರ ನೀಡುತ್ತದೆ. ಎಐ ಹೀಗೆ ಇಲ್ಲದ ಮಾಹಿತಿಯನ್ನು ತಾನೇ ಸೃಷ್ಟಿಸಿ ಉತ್ತರಿಸುವುದಕ್ಕೆ ಹ್ಯಾಲುಸಿನೇಷನ್ ಎನ್ನಲಾಗುತ್ತದೆ.
ಈ ಸುಳ್ಳಿನ ಕಂತೆಗೆ ಕಾರಣ ಏನು?
ಎಐ ಸದ್ಯದ ಮಟ್ಟಿಗೆ ‘ಮುಂದಿನ ಪದ ಯಾವುದು ಇರಬಹುದು?’ ಎಂದು ಊಹಿಸುವ ಒಂದು ಗಣಿತದ ಸಂಭವನೀಯತೆಯ ಮಾದರಿಯಷ್ಟೇ. ನೀವು ಕೇಳಿದ ಪ್ರಶ್ನೆಗೆ ಅದರ ಡೇಟಾಬೇಸ್ನಲ್ಲಿ ಸರಿಯಾದ ಉತ್ತರ ಇಲ್ಲದಿದ್ದಾಗ, ಅದು ತನ್ನ ಹತ್ತಿರವಿರುವ ಹಳೆಯ ಪದಗಳನ್ನು ಜೋಡಿಸಿ ವ್ಯಾಕರಣಬದ್ಧವಾಗಿ ಅತ್ಯಂತ ಸುಂದರವಾದ ಸುಳ್ಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಅದು ಆ ಸುಳ್ಳನ್ನು ಎಷ್ಟು ಆತ್ಮವಿಶ್ವಾಸದಿಂದ, ಸತ್ಯದ ಮರೆಯಲ್ಲಿ ನಮ್ಮ ಮುಂದೆ ಪ್ರಸ್ತುತಪಡಿಸುವುದರಿಂದ ಅದನ್ನು ಓದುವ ಸಾಮಾನ್ಯರು ಸುಳ್ಳು ಎಂದು ಪತ್ತೆ ಹಚ್ಚುವುದು ತುಂಬಾ ಕಷ್ಟ.
ಇತ್ತೀಚಿನ ದಿನಗಳಲ್ಲಿ ಓಪನ್ಎಐನ o1, o3 ಅಥವಾ ಡೀಪ್ಸೀಕ್ R1 (DeepSeek-R1) ನಂತಹ ಅತ್ಯಾಧುನಿಕ ತರ್ಕಬದ್ಧ ಎಐ ಮಾದರಿಗಳು ಮಾರುಕಟ್ಟೆಗೆ ಬಂದಿದ್ದು, ಅವುಗಳು ತಾವೇ ಸ್ವತಃ ಯೋಚಿಸಿ, ಆಂತರಿಕವಾಗಿ ಮರುಪರಿಶೀಲನೆ ಮಾಡಿಕೊಂಡು ಸರಿಯಾದ ನಿರ್ಧಾರಗಳನ್ನು ನೀಡಲು ಯತ್ನಿಸುತ್ತವೆ. ಇವು ಹ್ಯಾಲುಸಿನೇಷನ್ ಪ್ರಮಾಣವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಿವೆಯಾದರೂ, ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಮಿತಿ ಮುಗಿದಾಗ ಅಥವಾ ಡೇಟಾ ಕೊರತೆಯಿದ್ದಾಗ ಇವುಗಳೂ ಸಹ ತಪ್ಪು ಮಾಹಿತಿ ನೀಡಲು ಆರಂಭಿಸುತ್ತವೆ. ವಿಶೇಷವಾಗಿ ಕನ್ನಡ ಸೇರಿದಂತೆ ಭಾರತೀಯ ಭಾಷೆಗಳಲ್ಲಿ ಟೋಕನ್ಗಳು ಬೇಗನೆ ಖಾಲಿಯಾಗುವುದರಿಂದ ಮತ್ತು ಆನ್ಲೈನ್ನಲ್ಲಿ ಅಧಿಕೃತ ಡಿಜಿಟಲ್ ಡೇಟಾ ಕಡಿಮೆ ಇರುವುದರಿಂದ ಇಂಗ್ಲಿಷ್ಗೆ ಹೋಲಿಸಿದರೆ ನಮ್ಮ ಭಾಷೆಗಳಲ್ಲಿ ಹ್ಯಾಲುಸಿನೇಷನ್ ಸಾಧ್ಯತೆ ತೀರಾ ಹೆಚ್ಚಿರುತ್ತದೆ.
ಎಚ್ಚರ ಮತ್ತು ಜಾಣ್ಮೆಯ ಬಳಕೆ
ಎಐ ಬಳಸುವಾಗ ಟೋಕನ್ಗಳನ್ನು ಉಳಿಸಲು ಮತ್ತು ಎಐನ ಕಟ್ಟುಕಥೆಯಿಂದ ಪಾರಾಗಲು ಜಾಣ್ಮೆಯಿಂದ ವ್ಯವಹರಿಸಬೇಕು.
1. ನ್ಯೂ ಚಾಟ್ ಬಳಸಿ: ಒಂದು ವಿಷಯದ ಚರ್ಚೆ ಅಥವಾ ಕೆಲಸ ಮುಗಿದ ತಕ್ಷಣ ‘ನ್ಯೂ ಚಾಟ್’ ಆರಂಭಿಸಿ. ಇದರಿಂದ ಹಳೆಯ ನೆನಪಿನ ಗೊಂದಲ ಹಾಗೂ ಹ್ಯಾಲುಸಿನೇಷನ್ ತಪ್ಪಿಸಬಹುದು.
2. ಸ್ಪಷ್ಟ ಪ್ರಾಂಪ್ಟ್ ನೀಡಿ: ನೇರ ಮತ್ತು ನಿಖರವಾದ ಸಂಭಾಷಣೆ ಮೂಲಕ ಅನಗತ್ಯ ಟೋಕನ್ ವ್ಯಯವಾಗುವುದನ್ನು ತಡೆಯಬಹುದು.
3. ಮರುಪರಿಶೀಲನೆ: ಎಐ ನೀಡುವ ಇತಿಹಾಸ, ವೈದ್ಯಕೀಯ, ಕಾನೂನು ಅಥವಾ ಗಣಿತದಂತಹ ಪ್ರಮುಖ ಮಾಹಿತಿಯನ್ನು ಕುರುಡಾಗಿ ನಂಬದೆ, ಅಧಿಕೃತ ಮೂಲಗಳಿಂದ ಮರುಪರಿಶೀಲಿಸುವುದು ಅತ್ಯಗತ್ಯ.
ಪ್ರಸ್ತುತ ಗೂಗಲ್ ಜೆಮಿನಿ 1.5 ಪ್ರೊ (Gemini 1.5 Pro) ಸುಮಾರು 20 ಲಕ್ಷ ಟೋಕನ್ಗಳ ದೀರ್ಘ ಮಿತಿ, ಜಿಪಿಟಿ-4o (GPT-4o) 1.28 ಲಕ್ಷ ಟೋಕನ್ ಮತ್ತು ಕ್ಲಾಡ್ ಸಾನೆಟ್ (Claude 3.5 Sonnet) 2 ಲಕ್ಷ ಟೋಕನ್ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಹೊಂದಿರುವ ಮಾದರಿಗಳು ಲಭ್ಯವಿವೆ. ಅಲ್ಲದೆ ಮುಂದಿನ ದಿನಗಳಲ್ಲಿ ಸ್ವದೇಶಿ ಟೋಕನೈಸರ್ಗಳಿಂದ ಕನ್ನಡದಲ್ಲೂ ಇಂಗ್ಲಿಷ್ನಷ್ಟೇ ದೀರ್ಘ ಜ್ಞಾಪಕ ಶಕ್ತಿ ಸಿಗುವ ನಿರೀಕ್ಷೆಯಿದೆ. ಆದರೂ ಅಲ್ಲಿಯವರೆಗೆ ಎಐನ ಮಿತಿಗಳನ್ನರಿತು ಎಚ್ಚರ ಹಾಗೂ ಜಾಣ್ಮೆಯಿಂದ ವರ್ತಿಸುವುದೇ ನಿಖರ ಮಾಹಿತಿ ಪಡೆಯಲು ಮತ್ತು ತಾಂತ್ರಿಕ ವೆಚ್ಚವನ್ನು ಉಳಿಸಲು ಇರುವ ಸೂಕ್ತ ಮಾರ್ಗವಾಗಿದೆ.


