মেটার নতুন এআই
একাধিক ভাষা ও বক্তার কথা টেক্সটে রূপান্তর
প্রকাশ : ০৫ সেপ্টেম্বর ২০২৬, ০০:০০ | প্রিন্ট সংস্করণ
প্রযুক্তি প্রতিবেদক

একটি দীর্ঘ বৈঠক বা আলোচনায় একাধিক ব্যক্তি একসঙ্গে কথা বললে এবং কথোপকথনের মধ্যে বিভিন্ন ভাষা ব্যবহার করা হলে পরে অডিও রেকর্ডিং থেকে কে কী বলেছেন, তা আলাদা করে শনাক্ত করা বেশ জটিল হয়ে উঠতে পারে। এমন জটিল ও বহুভাষী কথোপকথনের সময় রিয়েলটাইমে বক্তব্য লিখিত আকারে রূপান্তরের পাশাপাশি প্রতিটি বক্তাকে আলাদাভাবে শনাক্ত করার সক্ষমতা নিয়ে সম্প্রতি নতুন এআই মডেল 'মিউজ ভয়েস ট্রান্সক্রাইব' উন্মোচন করেছে মেটা।
মেটার সুপারইন্টেলিজেন্স ল্যাবস গত ১ সেপ্টেম্বর 'মিউজ ভয়েস ট্রান্সক্রাইব' লঞ্চ করে। এটি প্রতিষ্ঠানটির প্রথম রিয়েলটাইম অডিও পারসেপশন মডেল। একই সঙ্গে কথাকে লেখায় রূপান্তর, বক্তা শনাক্তকরণ এবং বক্তার কথা শেষ হওয়ার সময় নির্ধারণের মতো জটিল কাজ করতে পারে এটি। মেটার দাবি, ২০ জনের বেশি বক্তার দীর্ঘ কথোপকথনও মডেলটি অনায়াসে প্রক্রিয়া করতে সক্ষম।
বর্তমানে প্রচলিত অডিও ট্রান্সক্রাইবারগুলো একটি ভিডিও বা অডিও ফাইল থেকে বক্তব্য বা কথোপকথন একাধারে টেক্সটে রূপান্তর করতে পারে। তবে একাধিক বক্তা বা বহুভাষী কথোপকথনের ক্ষেত্রে আলাদাভাবে বক্তা শনাক্ত করা সম্ভব হয় না এবং রূপান্তর প্রক্রিয়াতেও অনেক ভুল হয়ে থাকে। মেটার নতুন এ মডেলটি প্রচলিত ট্রান্সক্রাইবারের এসব সীমাবদ্ধতা দূর করতে সক্ষম।
মডেলটির অবকাঠামোগত প্রযুক্তিগুলোর অন্যতম হলো স্ট্রিমিং অটোমেটিক স্পিচ রিকগনিশন বা এএসআর। প্রচলিত ট্রান্সক্রিপশন ব্যবস্থায় সাধারণত পুরো অডিও রেকর্ড হওয়ার পর তা বিশ্লেষণ করা হয়। অন্যদিকে, স্ট্রিমিং এএসআর কথোপকথন চলার সময়ই ধাপে ধাপে বক্তব্যকে টেক্সটে রূপান্তর করে।
