চ্যাটবট ব্যবহার করতে সাধারণত প্রশ্নটি ইন্টারনেট দিয়ে কোনো কোম্পানির সার্ভারে পাঠাতে হয়। কিন্তু এখন ছোট আকারের ভাষা মডেল সরাসরি ফোনে চালানো সম্ভব। একে বলা হয় লোকাল LLM বা অন-ডিভাইস ভাষা মডেল। মডেলটি একবার ফোনে নামানো হলে লেখা তৈরি, সারসংক্ষেপ, প্রশ্নোত্তর কিংবা ধারণা সাজানোর মতো অনেক কাজ ইন্টারনেট ছাড়াই করা যায়।
লোকাল LLM আসলে কী
LLM বা লার্জ ল্যাঙ্গুয়েজ মডেল হলো বিপুল লেখার ধরন থেকে ভাষার প্যাটার্ন শেখা একটি সফটওয়্যার। ক্লাউডভিত্তিক সেবায় মডেলটি দূরের ডেটা সেন্টারে চলে, আর লোকাল ব্যবস্থায় তার ছোট ও সংকুচিত সংস্করণ ফোনের প্রসেসর, গ্রাফিকস চিপ বা সমর্থিত হলে NPU ব্যবহার করে। ফলে নেটওয়ার্ক না থাকলেও উত্তর পাওয়া যায় এবং সম্পূর্ণ অফলাইনে চলা অ্যাপে প্রম্পট ফোনের ভেতরেই থাকতে পারে। তবে কোনো অ্যাপ ইনস্টল করার আগে তার অনুমতি ও গোপনীয়তা নীতি দেখে নেওয়া জরুরি।
সবচেয়ে সহজ পথ: Google AI Edge Gallery
প্রোগ্রামিং না জানলেও শুরু করার সবচেয়ে সরল উপায় হলো Google AI Edge Gallery। গুগলের তথ্য অনুযায়ী অ্যাপটি অ্যান্ড্রয়েড ও iOS—দুই প্ল্যাটফর্মেই সমর্থিত ডিভাইসে লোকাল মডেল চালাতে পারে এবং ডাউনলোডের পর কাজটি পুরোপুরি অফলাইনে সম্পন্ন হয়। অ্যাপের ভেতর থেকে মডেল বেছে নেওয়া, নামানো এবং চ্যাট বা Prompt Lab-এ পরীক্ষা করা যায়।
- অ্যাপ স্টোর বা প্লে স্টোর থেকে Google AI Edge Gallery ইনস্টল করুন।
- ফোনটি Wi-Fi-তে যুক্ত করে পর্যাপ্ত খালি জায়গা নিশ্চিত করুন।
- প্রথম পরীক্ষায় ০.৫ থেকে ১ বিলিয়ন প্যারামিটারের ছোট মডেল বেছে নিন।
- মডেল ডাউনলোড শেষ হলে বিমান মোড চালু করে একটি সাধারণ প্রশ্ন করুন। উত্তর এলে বুঝবেন মডেলটি লোকালভাবে চলছে।
- একই প্রশ্ন কয়েকটি মডেলে করে গতি, উত্তরের মান, তাপ ও ব্যাটারি ব্যবহারের পার্থক্য দেখুন।
গুগলের বর্তমান সমর্থিত মডেল তালিকায় Qwen2.5-0.5B-এর আকার প্রায় ৫২১ মেগাবাইট, Qwen3-0.6B প্রায় ৫৮৬ মেগাবাইট এবং Gemma 3 1B প্রায় ১,০০৫ মেগাবাইট। নতুন ব্যবহারকারীর জন্য এই ছোট মডেলগুলো বাস্তবসম্মত শুরু। ফাইলের আকারই মোট RAM ব্যবহারের সমান নয়; চালানোর সময় অতিরিক্ত মেমোরি প্রয়োজন হয়।
আইফোনে আরেকটি সহজ বিকল্প
iPhone বা iPad ব্যবহারকারীরা MLC Chat-ও বিবেচনা করতে পারেন। MLC-এর অফিসিয়াল নির্দেশিকায় App Store-এর প্রস্তুত অ্যাপকে সাধারণ ব্যবহারকারীর জন্য প্রস্তাব করা হয়েছে। অ্যাপটি সমর্থিত মডেল ফোনে নামিয়ে লোকালভাবে চালায়। বড় মডেল নেওয়ার আগে ছোট মডেল দিয়ে শুরু করাই ভালো, কারণ iOS ডিভাইসের মেমোরি সীমা ও তাপমাত্রা দ্রুত বাধা হতে পারে।
কোন ফোনে ভালো চলবে
লোকাল AI-এর অভিজ্ঞতা ফোনের RAM, চিপ, তাপ নিয়ন্ত্রণ, ব্যাটারি এবং মডেলের আকারের ওপর নির্ভর করে। গুগলের পুরোনো MediaPipe LLM Inference নির্দেশিকায় উচ্চক্ষমতার অ্যান্ড্রয়েড—যেমন Pixel 8 বা Samsung S23 এবং পরের মডেল—লক্ষ্য করে অপ্টিমাইজেশনের কথা বলা হয়েছিল। তবে সেই API এখন শুধু রক্ষণাবেক্ষণ পর্যায়ে; নতুন অ্যান্ড্রয়েড প্রকল্পে গুগল LiteRT-LM ব্যবহারের পরামর্শ দিচ্ছে।
মধ্যম ক্ষমতার ফোনে ০.৫B বা ০.৬B মডেল দিয়ে শুরু করুন। ১B মডেল গ্রহণযোগ্য হলে পরে ১.৫B বা বড় মডেল চেষ্টা করা যায়। ফোন অস্বাভাবিক গরম হলে, অ্যাপ বন্ধ হয়ে গেলে বা উত্তর খুব ধীর হলে ছোট মডেলে ফিরে আসুন। চার্জে লাগানো অবস্থায় দীর্ঘ পরীক্ষা না করাই নিরাপদ।
লোকাল LLM দিয়ে কী করা যায়
- ইন্টারনেট ছাড়াই খসড়া, তালিকা ও ছোট বার্তা তৈরি করা।
- নিজের দেওয়া লেখার সারসংক্ষেপ বা ভাষা ঠিক করা।
- ব্রেইনস্টর্মিং, পড়ার প্রশ্ন এবং সাধারণ কোডের নমুনা পাওয়া।
- নেটওয়ার্ক দুর্বল জায়গায় ব্যক্তিগত নোট নিয়ে কাজ করা।
তবে লোকাল মডেলকে সার্চ ইঞ্জিন ভাবা ঠিক নয়। মডেলের প্রশিক্ষণের পরের ঘটনা সে জানে না, লাইভ ওয়েব দেখে না এবং আত্মবিশ্বাসের সঙ্গে ভুল তথ্যও দিতে পারে। চিকিৎসা, আইন, অর্থ বা নিরাপত্তাসংক্রান্ত সিদ্ধান্তে তার উত্তর স্বাধীন উৎস দিয়ে যাচাই করতে হবে।
ডেভেলপারদের জন্য তিনটি পথ
LiteRT-LM: অ্যান্ড্রয়েডে Kotlin API স্থিতিশীল এবং iOS-এর Swift API এখনো প্রাথমিক প্রিভিউ পর্যায়ে। একই প্রযুক্তি CPU ও GPU ব্যবহার করতে পারে; সমর্থিত অ্যান্ড্রয়েডে NPU-ও কাজে লাগানো যায়। নতুন Google-ভিত্তিক অ্যাপের জন্য এটিই বর্তমান পথ।
MLC LLM: অ্যান্ড্রয়েড SDK দিয়ে নিজস্ব অ্যাপ বানাতে Android Studio, NDK, CMake ও JDK 17 দরকার। iOS-এ Swift SDK এবং উৎস থেকে অ্যাপ তৈরির নির্দেশিকা রয়েছে। যারা নির্দিষ্ট মডেল, UI বা মডেল প্যাকেজিং নিয়ন্ত্রণ করতে চান, তাদের জন্য এটি কার্যকর।
llama.cpp ও MLX Swift: llama.cpp বিভিন্ন মাত্রার quantization সমর্থন করে, যার মাধ্যমে মডেলের আকার ও মেমোরি চাহিদা কমানো যায়; এটি Metal, Vulkanসহ নানা ব্যাকএন্ডে চলে। Apple-এর MLX Swift উদাহরণভাণ্ডারে iOS ও macOS-এ ভাষা মডেল চালানোর নমুনা অ্যাপ রয়েছে। এই দুটি পথ সাধারণ ব্যবহারকারীর চেয়ে ডেভেলপার ও পরীক্ষকদের জন্য বেশি উপযোগী।
শুরু করার আগে ছোট চেকলিস্ট
- শুধু অফিসিয়াল স্টোর বা যাচাই করা ওপেন সোর্স প্রকল্প থেকে অ্যাপ নিন।
- মোবাইল ডেটা বাঁচাতে Wi-Fi দিয়ে মডেল ডাউনলোড করুন।
- অন্তত মডেল ফাইলের আকারের চেয়ে বেশি খালি স্টোরেজ রাখুন।
- প্রথমে ছোট মডেল নিন এবং অফলাইন পরীক্ষা করুন।
- সংবেদনশীল তথ্য দেওয়ার আগে অ্যাপটি সত্যিই অফলাইনে চলে কি না এবং কী অনুমতি নিয়েছে তা দেখুন।
- গুরুত্বপূর্ণ তথ্য সবসময় অন্য নির্ভরযোগ্য উৎস দিয়ে যাচাই করুন।
শেষ কথা
মোবাইলে লোকাল LLM এখন আর শুধু গবেষণাগারের পরীক্ষা নয়। সবচেয়ে সহজ অভিজ্ঞতার জন্য AI Edge Gallery বা MLC Chat দিয়ে ছোট মডেল চালিয়ে দেখা যায়, আর ডেভেলপাররা LiteRT-LM, MLC, llama.cpp বা MLX Swift ব্যবহার করে নিজস্ব অ্যাপ বানাতে পারেন। ক্লাউডের বড় মডেলের সমান ক্ষমতা আশা না করে গোপনীয়তা, অফলাইন ব্যবহার এবং ছোট দৈনন্দিন কাজকে লক্ষ্য করলে প্রযুক্তিটি আজই কাজে লাগানো সম্ভব।
