OCR টেক্সট সনাক্তকরণ এবং ট্রান্সক্রিপশন টীকা
কীভাবে শাইপ বিভিন্ন ধরনের টেক্সট উৎস—যেমন মুদ্রিত নথি, হস্তাক্ষর, সাইনবোর্ড, লাইসেন্স প্লেট, রসিদ—থেকে শব্দ-স্তরের বাউন্ডিং বক্স ও অক্ষর-স্তরের ট্রান্সক্রিপশন অ্যানোটেশন প্রদান করেছেন, যা ৯৯% নির্ভুলতার সাথে একটি প্রোডাকশন-গ্রেড ওসিআর এবং ডকুমেন্ট ইন্টেলিজেন্স ডেটাসেট হিসেবে তৈরি হয়েছে।
প্রজেক্ট সারসংক্ষেপ
OCR যখন পরিষ্কার মুদ্রিত নথি ছাড়িয়ে বাস্তব জগতের দৃশ্যের টেক্সট এবং ডকুমেন্ট ইন্টেলিজেন্সের দিকে অগ্রসর হচ্ছে, তখন ক্লায়েন্টের এমন একটি অ্যানোটেশন পাইপলাইনের প্রয়োজন ছিল যা স্থানিক এবং অক্ষর-স্তরীয় উভয় নির্ভুলতার সাথে বিভিন্ন ধরণের টেক্সট, ফন্ট, ওরিয়েন্টেশন, ভাষা এবং পৃষ্ঠের অবস্থা পরিচালনা করতে সক্ষম।
শাইপ একটি এন্ড-টু-এন্ড অ্যানোটেশন পাইপলাইন তৈরি করেছেন, যা শব্দ-স্তরের বাউন্ডিং বক্স স্থাপন, অক্ষরের সঠিক প্রতিলিপি, বহু-বৈশিষ্ট্য ট্যাগিং এবং দ্বৈত স্থানিক ও প্রতিলিপি QA অন্তর্ভুক্ত করে — এবং ১০টিরও বেশি ধরনের টেক্সট উৎস থেকে মডেল-উপযোগী OCR ডেটাসেট তৈরি করেছে।
মূল পরিসংখ্যান
প্রতিটি ছবির জন্য টীকা
শত শত শব্দ
নির্ভুলতার সীমা
৮০%
পাঠ্য উৎস
10+
অ্যাট্রিবিউট লেয়ার
5
চ্যালেঞ্জ
- টীকা প্রতিটি দৃশ্যমান পাঠ্য উদাহরণ শব্দ স্তরে — ঘন ছবিতে শত শত
- মিশ্রন স্থানিক বাউন্ডিং বক্সের নির্ভুলতা সঙ্গে সঠিক অক্ষর-স্তরের প্রতিলিপি সমান্তরাল
- হ্যান্ডলিং বাঁকা, দৃষ্টিকোণ-বিকৃত এবং ঘূর্ণিত পাঠ্য সাইনবোর্ড এবং পণ্যের লেবেলে
- নকলনবিসি বিবর্ণ, কম কনট্রাস্ট এবং আংশিকভাবে অবরুদ্ধ অস্পষ্ট অক্ষর অনুমান না করে শব্দ
- পরিচালক মিশ্র-ভাষা এবং বহু-লিপি পাঠ্য একই ছবির মধ্যে
সমাধান
শব্দ-স্তরের স্থানিক টীকা
প্রতিটি ছবির প্রতিটি দৃশ্যমান টেক্সটকে শব্দ পর্যায়ে একটি সুনির্দিষ্ট বাউন্ডিং বক্স দিয়ে আলাদাভাবে চিহ্নিত করা হয়েছিল — যা প্রতিটি টেক্সট উপাদানের সঠিক স্থানিক অবস্থান তুলে ধরে। রসিদ বা ফর্মের মতো ঘন সন্নিবেশিত ছবিগুলোর ক্ষেত্রে, এর অর্থ ছিল প্রতি ছবিতে শত শত স্বতন্ত্র টীকা যোগ করা, যার প্রতিটিই ন্যূনতম অ্যালাইনমেন্ট নির্ভুলতা বজায় রাখত।
অক্ষর-স্তরের প্রতিলিপি
বাউন্ডিং বক্সের পাশাপাশি, অ্যানোটেটররা প্রতিটি শব্দের সঠিক পাঠ্য বিষয়বস্তু প্রতিলিপি করেছেন, যার মধ্যে সংখ্যা, বিশেষ অক্ষর, বিরামচিহ্ন এবং আলফানিউমেরিক সংমিশ্রণ অন্তর্ভুক্ত ছিল। এই দ্বৈত কর্মপ্রবাহ — স্থানিক + প্রতিলিপি — উভয় লেয়ার জুড়ে সামঞ্জস্যের নিয়ম মেনে সমান্তরালভাবে সম্পাদিত হয়েছিল।
বহু-উৎস কভারেজ
এর আওতায় অত্যন্ত বৈচিত্র্যময় বিভিন্ন উৎস অন্তর্ভুক্ত ছিল: মুদ্রিত নথি, হাতে লেখা নোট, রাস্তার সাইনবোর্ড, পণ্যের লেবেল, লাইসেন্স প্লেট, দোকানের সম্মুখভাগ, বিলবোর্ড, রসিদ, চালান, মেনু এবং ফর্মের ক্ষেত্রসমূহ। প্রতিটি উৎসের ধরনের জন্য তার দৃশ্যগত বৈশিষ্ট্যের সাথে সামঞ্জস্যপূর্ণ নিজস্ব টীকা লেখার নির্দেশিকা ছিল।
৫-স্তর অ্যাট্রিবিউট ট্যাগিং
প্রতিটি টীকাযুক্ত পাঠ্য অঞ্চলকে বিভিন্ন বৈশিষ্ট্য দিয়ে সমৃদ্ধ করা হয়েছিল, যার মধ্যে ছিল পাঠ্যের অভিমুখ (অনুভূমিক, উল্লম্ব, তির্যক), ভাষা ও লিপির ধরন, পাঠ্যের স্পষ্টতা (স্পষ্টভাবে পাঠযোগ্য, আংশিকভাবে পাঠযোগ্য, সম্পূর্ণ অপাঠ্য), ফন্টের ধরন (মুদ্রিত বনাম হস্তলিখিত), এবং পাঠ্যের পটভূমির ধরন (সাধারণ, নকশাযুক্ত, জটিল)। এই সমৃদ্ধ বৈশিষ্ট্য স্তরটি প্রশিক্ষিত মডেলটিকে সাধারণ ডকুমেন্ট ওসিআর-এর চেয়ে অনেক বেশি বৈচিত্র্যময় বাস্তব-জগতের পাঠ্য পরিস্থিতি সামলাতে সক্ষম করে।
দৃশ্যমানতার সীমা এবং দ্বৈত গুণমান নিশ্চিতকরণ
ন্যূনতম দৃশ্যমানতার সীমা কঠোর নির্দেশিকা দ্বারা নিয়ন্ত্রিত ছিল — ডেটাসেটের অখণ্ডতা বজায় রাখার জন্য, অস্পষ্ট লেখা অনুমান না করে চিহ্নিত করা হতো। প্রতিটি টীকাযুক্ত ছবি একটি দ্বি-স্তরীয় গুণমান নিশ্চিতকরণ (QA) প্রক্রিয়ার মধ্য দিয়ে যেত, যেখানে বাউন্ডিং বক্সের নির্ভুলতা পর্যালোচনা এবং প্রতিলিপির সঠিকতা যাচাই করা হতো এবং উভয় স্তরেই নির্ভুলতার সীমা ছিল ৯৯%।
প্রকল্পের সুযোগ
| ডেটাসেটের প্রকার | টীকা স্তর | সোর্স | আরোপ করা | QA | সঠিকতা |
|---|---|---|---|---|---|
| OCR টেক্সট সনাক্তকরণ + ট্রান্সক্রিপশন | শব্দ বাক্স + অক্ষরের প্রতিলিপি | ১০টিরও বেশি উৎস প্রকার | ৫টি অ্যাট্রিবিউট স্তর | দ্বৈত স্থানিক + ট্রান্সক্রিপশন QC | ৮০% |
ফলাফল
- প্রতিষ্ঠিত একটি দ্বৈত শব্দ-স্তরের স্থানিক + অক্ষর-স্তরের ট্রান্সক্রিপশন পাইপলাইন OCR AI এর জন্য
- প্রমিত ১০টিরও বেশি পাঠ্য উৎসের কভারেজ নথি, দৃশ্যের পাঠ্য এবং হস্তাক্ষর জুড়ে
- নিষ্কৃত ৫টি অ্যাট্রিবিউট স্তর দিকনির্দেশনা, ভাষা, স্পষ্টতা, ফন্ট এবং পটভূমির জন্য
- রক্ষণাবেক্ষণ ৯৯% নির্ভুলতা গেট স্থানিক এবং ট্রান্সক্রিপশন উভয় QA স্তর জুড়ে
- ক্লায়েন্টের সক্ষম করা হয়েছে ডকুমেন্ট ডিজিটাইজেশন, রিটেইল ওসিআর, নেভিগেশন, ব্যাংকিং এবং আইনি এআই অ্যাপ্লিকেশন
সামগ্রিকভাবে, শাইপ একাধিক উৎস থেকে প্রাপ্ত টেক্সট অ্যানোটেশনের প্রয়োজনীয়তাকে একটি সুসংগঠিত ও উৎপাদন-উপযোগী ওসিআর পাইপলাইনে রূপান্তরিত করতে সাহায্য করেছেন—যা দ্বৈত স্থানিক ও ট্রান্সক্রিপশন নির্ভুলতার সাথে ডকুমেন্ট ডিজিটাইজেশন, সিন টেক্সট ডিটেকশন, রিটেইল ইন্টেলিজেন্স, ব্যাংকিং অটোমেশন এবং লিগ্যাল কমপ্লায়েন্স এআই সমর্থন করতে সক্ষম।
শাইপ ওসিআর-এর এমন সব ব্যতিক্রমী পরিস্থিতি সামলেছে যা বেশিরভাগ পরিষেবা প্রদানকারী পারে না — যেমন বাঁকানো সাইনবোর্ডের লেখা, মিশ্র লিপি, বিবর্ণ রসিদ, হাতে লেখা নোট। বাউন্ডিং বক্স এবং ট্রান্সক্রিপশন উভয়ের উপর তাদের দ্বৈত গুণমান নিশ্চিতকরণ (QA) আমাদের এমন প্রশিক্ষণ ডেটা দিয়েছে যা আমরা ব্যবহার করতে পেরেছি।
— পরিচালক, ডকুমেন্ট এআই