
মানুষ বিরক্ত করছে। তারা অন্য কারোর শেষ বাক্যে হাসে, স্পীকার শেষ হওয়ার আগে দ্রুত সম্মতি দেয় এবং পটভূমিতে সঙ্গীত বা নড়াচড়ার সময় কথা বলা চালিয়ে যায়। একটি ভয়েস এআই বিকাশকারীর জন্য, এই দৈনন্দিন জগাখিচুড়ি একটি কঠিন ডেটা সমস্যা তৈরি করে: একটি রেকর্ডিংয়ে ঠিক সেই কথোপকথনমূলক আচরণ থাকতে পারে যা একটি মডেলকে শিখতে হবে, তবুও এটি একটি মিশ্র অডিও স্ট্রিম হিসাবে পৌঁছায়।
AudioShake এই ফাঁক ফোকাস শোধনাগারএকটি সম্প্রতি চালু করা সিস্টেম যা বিদ্যমান রেকর্ডিংগুলিকে কৃত্রিম বুদ্ধিমত্তা প্রশিক্ষণের জন্য স্পিকারগুলিতে কাঠামোগত এবং পৃথক ডেটাতে রূপান্তর করে৷ ডেভেলপারদের নতুন কথোপকথন পরিচালনা করতে বা সিন্থেটিক নমুনা তৈরি করতে বলার পরিবর্তে, কোম্পানিটি ইতিমধ্যেই ব্যবহারের অধিকার রয়েছে রেকর্ডিং সংস্থাগুলি থেকে পৃথক ভয়েস এবং অন্যান্য শব্দ উপাদানগুলি বের করার একটি উপায় অফার করে৷
ঘোষণাটি ভয়েস এআই বিকাশ প্রক্রিয়ার কেন্দ্রের কাছাকাছি অডিও বিচ্ছেদকে রাখে। আকর্ষণীয় প্রশ্ন হল যে ডেটাসেটগুলি একটি বাস্তব কথোপকথনের সময় এবং জটিলতা সংরক্ষণ করতে পারে যখন লেবেল করা, পরীক্ষা করা এবং ব্যবহার করা সহজ হয়ে ওঠে।
একটি সমাপ্ত রেকর্ডিংকে আলাদা স্পিকার ট্র্যাকে রূপান্তর করা হচ্ছে
অডিওশেকের ঘোষণা অনুসারে, মিউজিক এবং ব্যাকগ্রাউন্ড সাউন্ড থেকে সংলাপ আলাদা করার সময় রিফাইনারি কথোপকথনগুলিকে পৃথক স্পিকার ট্র্যাকগুলিতে বিভক্ত করতে পারে। এটি মূল রেকর্ডিং সেশন বা আলাদাভাবে ক্যাপচার করা ডালপালা ছাড়াই সরাসরি রেকর্ড করা অডিও থেকে কাজ করে। যখন দুইজন ব্যক্তি একবারে কথা বলেন, তখন লক্ষ্য হল ওভারল্যাপিং বিনিময় বজায় রেখে তাদের কণ্ঠস্বর আলাদাভাবে পুনরুত্পাদন করা।
একটি প্রভাবশালী ভয়েস অবশিষ্ট না হওয়া পর্যন্ত এটি একটি রেকর্ডিং পরিষ্কার করা থেকে আলাদা। অবাঞ্ছিত গোলমালের পরিবর্তে ঝামেলা গুরুত্বপূর্ণ প্রশিক্ষণ তথ্য হতে পারে। একটি সংক্ষিপ্ত স্বীকৃতি বোঝাতে সাহায্য করতে পারে যে কেউ শুনছেন, সম্মত হচ্ছেন বা একটি পালা নেওয়ার প্রস্তুতি নিচ্ছেন কিনা। একটি বিনিময়কে এক স্ট্রীমে সমতল করা এই আচরণগুলিকে সঠিক স্পিকারের সাথে যুক্ত করা আরও কঠিন করে তুলতে পারে।
আউটপুট সম্পর্কে চিন্তা করার একটি দরকারী উপায় হল সারিবদ্ধ ট্র্যাকের একটি সেট। একজন একটি নির্দিষ্ট স্পিকারের কণ্ঠস্বর বহন করে, অন্যটি দ্বিতীয় স্পিকারের ভয়েস বহন করে এবং তাদের যৌথ সময় প্রকাশ করে যখন তারা ওভারল্যাপ করে। কথোপকথন নিজেই প্রতিলিপি না করে রেকর্ডিং পর্যালোচনা করা সহজ হয়ে ওঠে।
অডিওশেক বলে যে সিস্টেমটি বক্তৃতা তৈরি বা পুনরুত্পাদন করে না: পৃথক করা শব্দ এবং তাদের সংশ্লিষ্ট ফ্রিকোয়েন্সিগুলি মূল রেকর্ডিং থেকে আসে। প্রকৃত কথোপকথনমূলক আচরণের উদাহরণ খুঁজছেন এমন বিকাশকারীদের জন্য এই পার্থক্যটি গুরুত্বপূর্ণ। বিন্যাসটি কী রেকর্ড করা হয়েছিল তা প্রকাশ করার জন্য, এর একটি নতুন উপস্থাপনা তৈরি করার পরিবর্তে।
কেন বক্তা বিচ্ছেদ ডায়েরি ছাড়িয়ে যায়
অডিওশেকের মাল্টি-স্পীকার সেপারেশন প্রোডাক্ট পেজ স্পিকার বিচ্ছেদ এবং সমন্বয়ের সমন্বয় বর্ণনা করে। একটি লগ সনাক্ত করে যখন বিভিন্ন স্পিকার সক্রিয় থাকে; বিচ্ছেদ পৃথক অডিও সংকেত তৈরি করে। একটি সময়ের ব্যবধান দুটি স্পিকার ধারণকারী হিসাবে লেবেল করা নিজেই বিকাশকারীকে দুটি স্বাধীনভাবে ব্যবহারযোগ্য সাউন্ড ট্র্যাক দেয় না।
পণ্যটি সঠিক স্পিকারের কাছে অডিও বরাদ্দ করার আত্মবিশ্বাস এবং বিচ্ছেদের মানের আস্থার মধ্যেও পার্থক্য করে। এইগুলি বিভিন্ন সমস্যার সমাধান করে: আপনি সঠিকভাবে একটি ভয়েস বরাদ্দ করতে পারেন এবং এখনও অন্য ব্যক্তির একটি ভয়েস ধারণ করতে পারেন। অডিওশেক মৌলিক সিস্টেমটিকে শাব্দিক হিসাবে বর্ণনা করে, একটি ভাষা মডেল থেকে স্বাধীন, এবং বিভিন্ন নমুনা হার এবং ক্যাপচার অবস্থার সাথে রেকর্ডিং সমর্থন করে।
একটি প্রশিক্ষণ পাইপলাইনের জন্য, এই ফাংশনগুলি আলাদা করা পর্যালোচনাটিকে আরও সঠিক করে তুলতে পারে। একটি দলকে স্পিকারের পরিচয়, একটি নির্দিষ্ট ট্র্যাকের স্বচ্ছতা বা পরবর্তীতে তৈরি করা ট্রান্সক্রিপশনের যথার্থতা পরীক্ষা করতে হতে পারে। তিনটিকেই একক সাফল্য বা ব্যর্থতা হিসাবে বিবেচনা করলে ডেটা সেটে একটি ত্রুটি কোথায় প্রবেশ করেছে তা লুকিয়ে রাখবে।
গুণমানের স্কোরগুলি ডেটা পাইপলাইনের অংশ
শোধনাগারটি গুণমান এবং নিশ্চয়তার জন্য ফলন অর্জন করে, সংস্থাগুলিকে ব্যবহারযোগ্য, মেরামতযোগ্য, বা অনুপযুক্ত উপাদানগুলিতে বড় সংগ্রহগুলি সাজানোর অনুমতি দেয়। এটি একটি গুরুত্বপূর্ণ অপারেশনাল বৈশিষ্ট্য। একটি উল্লেখযোগ্য অডিও সংরক্ষণাগারের স্কেলে, পৃথকীকরণ নিজেই স্বয়ংক্রিয় হলেও প্রতিটি মিনিট ম্যানুয়ালি শোনা একটি বাধা হয়ে দাঁড়ায়৷
স্কোরগুলি সন্দেহজনক অনুচ্ছেদের দিকে মানুষের দৃষ্টি আকর্ষণ করতে সাহায্য করতে পারে। উদাহরণস্বরূপ, একটি ডেটা সেট দল একটি ঘন কথোপকথনকে অগ্রাধিকার দিতে পারে যেখানে একই তীব্রতায় একজন ব্যক্তির একটি কঠিন রেকর্ডিং পর্যালোচনা করার পরিবর্তে একটি শান্ত স্পিকারকে আলাদা করা কঠিন।
ব্যবস্থাপনার জন্য একটি বাণিজ্য বন্ধ আছে. শুধুমাত্র সবচেয়ে সহজ এবং সবচেয়ে সুস্পষ্ট ক্লিপ নির্বাচন করা একটি ডেটা সেট তৈরি করতে পারে যা প্রকল্পটি ক্যাপচার করার উদ্দেশ্যে করা কঠিন পরিস্থিতিগুলি মিস করে। আমাদের মতে, এই ধরনের পাইপলাইন ব্যবহারকারী দলগুলির আউটপুটের গুণমান এবং ফিল্টারিং থেকে বেঁচে থাকা কথোপকথনের বৈচিত্র্য উভয়কেই মূল্য দেওয়া উচিত। সতর্ক পর্যালোচনা সহ চ্যালেঞ্জিং নমুনাগুলি ধরে রাখা একটি একক ক্রমবর্ধমান আত্মবিশ্বাসের স্কোর সর্বাধিক করার চেয়ে বেশি কার্যকর হতে পারে।
তাই প্রশিক্ষণের প্রস্তুতির সাথে আলাদা ফাইল তৈরির চেয়ে বেশি কিছু জড়িত। বিকাশকারীদের এখনও নির্ধারণ করতে হবে কীভাবে গুণমানের ট্র্যাক, প্রতিলিপি, সময়, স্পিকার লেবেল এবং মেটাডেটা তাদের নির্দিষ্ট শিক্ষার উদ্দেশ্যের সাথে খাপ খায়।
অডিওশেক বেঞ্চমার্ক কী দেখায় – এবং এর সীমা
এর মাল্টি-স্পিকার 2.0 প্রযুক্তিগত মূল্যায়নে, অডিওশেক LiriCSS-এ ন্যূনতম সংযোজিত শব্দ ত্রুটির হার 9.17% রিপোর্ট করেছে, যা পরীক্ষিত MERL TF-Locoformer বেঞ্চমার্কের জন্য 37.75% এর তুলনায়। উভয়ই একই হুইস্পার বড়-ভি 3 ট্রান্সক্রিপ্ট পাইপলাইন ব্যবহার করে মূল্যায়ন করা হয়েছিল। নিম্ন ত্রুটির হার এই অনুমানে কম ট্রান্সক্রিপশন ত্রুটি নির্দেশ করে।
যোগ্যতা গুরুত্বপূর্ণ: প্রশিক্ষণের সুযোগের বাইরে ভিত্তি বাধা পরীক্ষা করা হয়েছে। অডিওশেক স্পষ্টভাবে এটিকে একটি অফ-দ্য-শেল্ফ তুলনা হিসাবে ফ্রেম করে, প্রমাণের পরিবর্তে যে একটি আর্কিটেকচার মিলিত প্রশিক্ষণের শর্তে সহজাতভাবে উন্নত। তার মূল্যায়ন আরও উল্লেখ করে যে ওভারল্যাপ চলতে থাকে এবং স্পিকারের সংখ্যা বৃদ্ধির সাথে সাথে নির্ভুলতা বজায় রাখা আরও কঠিন হয়ে পড়ে।
এগুলি কোম্পানির দ্বারা রিপোর্ট করা ফলাফল, প্রতিটি শোধনাগার লেআউটের একটি স্বাধীন মূল্যায়ন নয়। শিরোনামের উন্নতি অন্য ডেটা সেটে অপরিবর্তিত স্থানান্তর করা হয়েছে বলে অনুমান করার পরিবর্তে তারা প্রতিনিধিত্বমূলক অডিওতে প্রযুক্তি পরীক্ষা করা সমর্থন করে।
পৃথকীকরণের গুণমান এবং ডাউনস্ট্রিম মডেলের কর্মক্ষমতাও ভিন্ন ফলাফল। একটি ক্লিনার প্রশিক্ষণ কর্পাস মূল্যবান হতে পারে, তবে রোলআউট নির্ধারণ করে না যে এটি থেকে শেখার পরে একটি নির্দিষ্ট কথোপকথনের মডেল কতটা উন্নত হবে। এটির জন্য একটি পৃথক পরীক্ষার প্রয়োজন, উদ্দেশ্যযুক্ত প্রয়োগ এবং মূল্যায়নের শর্তগুলি সংজ্ঞায়িত করা হয়েছে৷
মিডিয়া ওয়ার্কফ্লো থেকে এআই ডেটা অবকাঠামো
অডিওশেক সঙ্গীত এবং মিডিয়া উত্পাদন থেকে অভিজ্ঞতা নিয়ে আসে। এর কোম্পানির ওয়েবসাইট মিক্সিং, স্থানীয়করণ, অডিও বিশ্লেষণ এবং অডিওভিজ্যুয়াল এডিটিং সহ কাজের মধ্যে অডিওকে আলাদা করার বর্ণনা দেয় এবং ESPN, ইউনিভার্সাল মিউজিক গ্রুপ এবং ওয়ার্নার ব্রোসের মতো ক্লায়েন্টদের তালিকা করে।
রিফাইনারি কৃত্রিম বুদ্ধিমত্তার বিকাশের জন্য অনুরূপ ধারণা প্রয়োগ করে: একটি বিদ্যমান রেকর্ডিং এর উপাদানগুলিকে উন্মুক্ত করে আরও উপযোগী করে তোলে। অডিওশেকের ডেটা পরিষেবা পৃষ্ঠাটি গ্রাহকদের নিজস্ব সামগ্রী থেকে ডেটাসেট প্রস্তুত করা এবং নির্দিষ্ট ক্যাটালগগুলির জন্য পৃথকীকরণের জন্য বিশেষ মডেলগুলি বিকাশের বর্ণনা দেয়৷
এটি কোনও মিডিয়া সংরক্ষণাগারকে উপযুক্ত প্রশিক্ষণ সেট করে না। সংস্থাগুলিকে এখনও সনাক্ত করতে হবে কোন রেকর্ডিংগুলি তাদের উদ্দেশ্যমূলক ব্যবহারের জন্য উপযুক্ত এবং তারা উপাদানটির সাথে কী করতে পারবে তা নির্ধারণ করতে হবে। ঘোষণাটি বিশেষভাবে শোধনাগারের চারপাশে অডিও গ্রাহকদের ইতিমধ্যেই ব্যবহারের অধিকার রয়েছে।
ভয়েস এআই ডেভেলপারদের জন্য একটি হ্যান্ডস-অন টেস্ট
তার লঞ্চ ব্লগে, অডিওশেক 100 মিলিয়নেরও বেশি মিনিট প্রক্রিয়া করা হয়েছে এবং বলেছে যে প্রাথমিক সংস্করণগুলি গত এক বছরে ফ্রন্টিয়ার এআই ল্যাবগুলির সাথে ব্যক্তিগতভাবে স্থাপন করা হয়েছে। এটি তার গ্রাহকদের মধ্যে লুয়েল এবং রিম তালিকাভুক্ত করে, পাশাপাশি নামহীন ল্যাব এবং ডেটা বাজারগুলি। স্কেল কোম্পানি দ্বারা রিপোর্ট করা একটি পরিসংখ্যান অবশেষ.
ঘোষণা অনুযায়ী শোধনাগারটি AudioShake API এর মাধ্যমে ডেটা প্রক্রিয়া করতে পারে বা স্থানীয়ভাবে স্থাপন করা যেতে পারে। পরবর্তী বিকল্পটি এমনভাবে ডিজাইন করা হয়েছে যাতে সংগঠনগুলিকে তাদের পরিবেশের মধ্যে সংবেদনশীল বা মালিকানাধীন রেকর্ডিং পরিচালনা করতে দেয়। গ্রাহকরা তাদের ডেটা এবং আউটপুটগুলির মালিকানা বজায় রাখে।
সিস্টেমের মূল্যায়নকারী একজন বিকাশকারীর জন্য, একটি সম্পূর্ণ পরিষ্কার ডেমোর চেয়ে একটি প্রতিনিধি পরীক্ষা বেশি গুরুত্বপূর্ণ হবে। দরকারী প্রশ্নগুলির মধ্যে রয়েছে যে শান্ত স্পিকারগুলি বিচ্ছেদ থেকে বেঁচে থাকে কিনা, হস্তক্ষেপ সারিবদ্ধ থাকে কিনা, কতটা ম্যানুয়াল সংশোধন প্রয়োজন এবং ফলাফলের নমুনাগুলি উদ্দেশ্যযুক্ত শব্দ প্রয়োগকে উন্নত করে কিনা।
AudioShake এর লঞ্চ ব্লগ তার পদ্ধতির আরও পটভূমি প্রদান করে। শোধনাগারের বিস্তৃত অর্থ সহজ: বাস্তব কথোপকথনে দরকারী কাঠামো রয়েছে যা একটি স্ক্র্যাম্বল রেকর্ডিং লুকিয়ে রাখতে পারে। এই কাঠামোটি পুনর্গঠন করা বর্তমান অডিওকে ভয়েস এআই তৈরির জন্য আরও ব্যবহারিক সংস্থান করে তুলতে পারে যা লোকেদের কথা বলার উপায় পরিচালনা করে।










Leave a Reply