অপটিক্যাল ক্যারেক্টার রিকগনিশন (OCR) এখন রসিদ স্ক্যানিং, পরিচয় যাচাইকরণ, ইনভয়েস অটোমেশন, ঐতিহাসিক আর্কাইভ ডিজিটাইজেশন এবং স্টাইলাস-ভিত্তিক নোট অ্যাপের মতো কাজে ব্যবহৃত হচ্ছে। গ্র্যান্ড ভিউ রিসার্চের (২০২৪) তথ্যমতে, ২০৩০ সালের মধ্যে OCR বাজার ১৪.৮% সিএজিআর (CAGR) হারে ৩২.৯০ বিলিয়ন ডলারে পৌঁছাবে বলে অনুমান করা হচ্ছে, যেখানে ইন্টেলিজেন্ট ক্যারেক্টার রিকগনিশন—যা OCR-এর হস্তাক্ষর-পড়ার শাখা—সবচেয়ে দ্রুতগতিতে বৃদ্ধি পাবে। আপনি ডকুমেন্ট পার্সিং, সিন-টেক্সট ডিটেকশন বা হস্তাক্ষর ট্রান্সক্রিপশন যা-ই তৈরি করুন না কেন, আপনি যে OCR ডেটাসেটের উপর প্রশিক্ষণ দেন, তা-ই আপনার নির্ভুলতার সর্বোচ্চ সীমা নির্ধারণ করে। এই নির্দেশিকাটিতে ২২টি বিনামূল্যের, ওপেন-সোর্স OCR ডেটাসেট অন্তর্ভুক্ত রয়েছে—যার মধ্যে সেরা হস্তাক্ষর ডেটাসেটগুলোও আছে—যা ব্যবহারের ক্ষেত্র অনুযায়ী সাজানো এবং ২০২৪ সাল পর্যন্ত প্রকাশিত সেরা সংস্করণগুলো দিয়ে হালনাগাদ করা হয়েছে।
কী Takeaways
- OCR (অপটিক্যাল ক্যারেক্টার রিকগনিশন): এমন প্রযুক্তি যা মুদ্রিত, দৃশ্যমান বা হাতে লেখা পাঠ্যের ছবিকে যন্ত্রপাঠযোগ্য ডেটাতে রূপান্তরিত করে।
- OCR ডেটাসেটগুলোকে পাঁচটি গ্রুপে বিভক্ত করা হয়েছে: ডকুমেন্ট/ফর্ম, সিন টেক্সট, ডিজিট/ক্যারেক্টার, হস্তাক্ষর এবং বহুভাষিক।
- ডকুমেন্ট OCR ডেটাসেট ফর্ম এবং রসিদের মতো কাঠামোগত পৃষ্ঠাগুলি ক্যাপচার করুন; দৃশ্য-পাঠ্য ডেটাসেট বাস্তব পরিবেশে টেক্সট ক্যাপচার করুন।
- গবেষণাক্ষেত্রে IAM, MNIST, ICDAR এবং SROIE সর্বাধিক উদ্ধৃত OCR বেঞ্চমার্ক হিসেবে রয়ে গেছে।
- লাইসেন্সের শর্তাবলী ব্যাপকভাবে ভিন্ন হয় — বাণিজ্যিক প্রশিক্ষণের আগে প্রতিটি ওসিআর ডেটাসেট যাচাই করে নিন।
OCR (অপটিক্যাল ক্যারেক্টার রিকগনিশন) কি?
OCR হল এমন প্রযুক্তি যা বিভিন্ন ধরনের নথি, যেমন স্ক্যান করা কাগজের নথি, PDF, বা পাঠ্যের ছবি, সম্পাদনাযোগ্য এবং অনুসন্ধানযোগ্য ডেটাতে রূপান্তর করে। এটি দ্বারা কাজ করে:
- একটি ছবিতে পাঠ্যের গঠন বিশ্লেষণ করা
- লাইন এবং অক্ষর মধ্যে পাঠ্য ভাঙ্গন
- এই ভিজ্যুয়াল অক্ষরগুলিকে মেশিন-পাঠযোগ্য পাঠ্যে রূপান্তর করা হচ্ছে
সাধারণ ব্যবহার অন্তর্ভুক্ত:
- স্ক্যান করা নথিগুলিকে সম্পাদনাযোগ্য পাঠ্য ফাইলে রূপান্তর করা হচ্ছে
- মুদ্রিত বইকে ডিজিটালাইজ করা
- ফটো থেকে পাঠ্য বের করা হচ্ছে
- হাতে লেখা প্রেসক্রিপশনকে ডিজিটাল টেক্সটে রূপান্তর করা
- লাইসেন্স প্লেট স্বীকৃতি
আপনি কীভাবে সঠিক OCR ডেটাসেট নির্বাচন করেন?
একটি OCR ডেটাসেট নির্বাচন চারটি বিষয়ের উপর নির্ভর করে: টেক্সটের ধরন, ক্যাপচার পরিবেশ, অ্যানোটেশনের সূক্ষ্মতা এবং লাইসেন্স। মুদ্রিত ডকুমেন্টের OCR-এর জন্য প্রয়োজনীয় ট্রেনিং ডেটা, হাতে লেখা কারসিভ বা কার্ভড সিন টেক্সটের থেকে ভিন্ন হয়। ডকুমেন্ট ডেটাসেটগুলো ইনভয়েস, ফর্ম এবং রসিদের জন্য উপযুক্ত; সিন-টেক্সট ডেটাসেটগুলো সাইনেজ এবং পণ্য পাঠের জন্য উপযুক্ত; এবং হস্তাক্ষর ডেটাসেটগুলো নোট, পাণ্ডুলিপি এবং স্টাইলাস ইনপুটের জন্য উপযুক্ত। ওয়ার্ড-লেভেল এবং লাইন-লেভেল অ্যানোটেশনগুলো সম্পূর্ণ OCR পাইপলাইনকে সমর্থন করে, অন্যদিকে ক্যারেক্টার-লেভেল সেটগুলো ক্লাসিফিকেশন বেসলাইনের জন্য উপযুক্ত। সর্বদা লাইসেন্সের শর্তাবলী নিশ্চিত করুন, কারণ কিছু OCR ডেটাসেট শুধুমাত্র গবেষণার জন্য ব্যবহৃত হয় অথবা রেজিস্ট্রেশনের প্রয়োজন হয়।
সেরা ডকুমেন্ট এবং ফর্ম ওসিআর ডেটাসেটগুলো কী কী?
ডকুমেন্ট ওসিআর ডেটাসেটগুলো ইনভয়েস, ফর্ম, রসিদ এবং আইডি-র মতো কাঠামোগত পৃষ্ঠাগুলো পার্স করার জন্য মডেলকে প্রশিক্ষণ দেয়। এগুলো ব্যবসায়িক ডকুমেন্ট অটোমেশন এবং কী-ভ্যালু এক্সট্র্যাকশনকে শক্তিশালী করে।
- FUNSD — কোলাহলপূর্ণ ও বাস্তব চেহারার ১৯৯টি টীকাযুক্ত স্ক্যান করা ফর্ম। ফর্ম বোঝা এবং মূল-মান নিষ্কাশনের জন্য এটি একটি আদর্শ মানদণ্ড।
- SROIE — ICDAR 2019-এর প্রায় ১,০০০ রসিদের স্ক্যান করা ডেটাসেট, যা একই সেটে টেক্সট শনাক্তকরণ, স্বীকৃতি এবং তথ্য নিষ্কাশন সমর্থন করে।
- কর্ড — পোস্ট-ওসিআর পার্সিং-এর জন্য নির্মিত একটি সমন্বিত রসিদ ডেটাসেট, যাতে ইনভয়েস ও রসিদ অটোমেশনের জন্য সমৃদ্ধ ফিল্ড-স্তরের লেবেল রয়েছে।
- এক্সফান্ড — FUNSD-এর বহুভাষিক সংস্করণ, যা সাতটি ভাষা (জার্মান, স্প্যানিশ, ফরাসি, ইতালীয়, জাপানি, পর্তুগিজ, চীনা) অন্তর্ভুক্ত করে এবং প্রতিটি ভাষায় ১৯৯টি পৃষ্ঠা রয়েছে। বহুভাষিক ডকুমেন্ট এআই-এর জন্য আদর্শ।
- ডিডিআই-১০০ বাস্তব জগতের বিকৃতি, যেমন—বাঁকানো ভাব, ঝাপসা ভাব এবং নয়েজের কারণে সৃষ্ট প্রায় ১ লক্ষ বিকৃত ডকুমেন্ট ইমেজ শনাক্তকরণ ও স্বীকৃতির জন্য।
সেরা সিন টেক্সট ওসিআর ডেটাসেটগুলো কী কী?
সিন-টেক্সট ওসিআর ডেটাসেটগুলো সাইনবোর্ড, পণ্য এবং রাস্তার দৃশ্যের মতো প্রাকৃতিক ছবির লেখা পড়ার জন্য মডেলকে প্রশিক্ষণ দেয়। বাস্তব পরিবেশে ওসিআর-এর জন্য এগুলো অপরিহার্য, যেখানে পটভূমি অগোছালো থাকে।
- ICDAR শক্তিশালী পাঠ — বেশিরভাগ সিন-টেক্সট গবেষণার নেপথ্যের মানদণ্ড পরিবার, যার মধ্যে ওয়ার্ড-লেভেল বাউন্ডিং বক্স এবং ট্রান্সক্রিপশন সহ ফোকাসড ও ইনসিডেন্টাল সিন টেক্সট চ্যালেঞ্জগুলোও অন্তর্ভুক্ত।
- কোকো-টেক্সট এমএস-কোকো (MS-COCO) ইমেজের উপর স্তরবিন্যস্ত বৃহৎ আকারের দৃশ্য-পাঠ্য টীকা। প্রাকৃতিক দৃশ্যে বৃহৎ পরিসরে পাঠ্য শনাক্তকরণের জন্য শক্তিশালী।
- মোট-পাঠ্য — এটি বাঁকা এবং যথেচ্ছভাবে বিন্যস্ত টেক্সটের ক্ষেত্রে বিশেষভাবে পারদর্শী, যা পুরোনো OCR মডেলগুলোর একটি পরিচিত দুর্বলতা ছিল।
- SVT (স্ট্রিট ভিউ টেক্সট) — গুগল স্ট্রিট ভিউ থেকে সংগৃহীত শব্দচিত্র, যা প্রায়শই নিম্ন-রেজোলিউশনের এবং অত্যন্ত পরিবর্তনশীল। পেপারস উইথ কোড মিররগুলোর মাধ্যমে উপলব্ধ।
- হায়ারটেক্সট — হস্তলিখিত এবং মুদ্রিত উভয় প্রকারের দৃশ্যমান পাঠ্যের জন্য অনুচ্ছেদ থেকে লাইন ও শব্দ পর্যন্ত স্তরভিত্তিক টীকা সংযোজন। লেআউট-সচেতন OCR-এর জন্য উপযোগী।
সেরা ডিজিট এবং ক্যারেক্টার ওসিআর ডেটাসেটগুলো কী কী?
ডিজিট এবং ক্যারেক্টার ওসিআর ডেটাসেটগুলো নিয়ন্ত্রিত পরিবেশে স্বতন্ত্র প্রতীক শনাক্ত করার জন্য মডেলকে প্রশিক্ষণ দেয়। এগুলোই ক্লাসিফিকেশন বেসলাইনের জন্য আদর্শ সূচনা বিন্দু।
- এমএনআইএসটি — ৭০,০০০টি গ্রেস্কেল হাতে লেখা সংখ্যার ছবি। একটি সংখ্যা ক্লাসিফায়ার যাচাই করার জন্য এটিই দ্রুততম বেসলাইন।
- ইএমএনআইএসটি — NIST স্পেশাল ডেটাবেস 19 থেকে প্রাপ্ত ৮১৪,২৫৫টি হস্তলিখিত অক্ষর এবং সংখ্যা দিয়ে MNIST-কে সম্প্রসারিত করা হয়েছে।
- SVHN (স্ট্রিট ভিউ হাউস নাম্বার) — বাড়ির নম্বর থেকে নেওয়া ৬ লক্ষেরও বেশি বাস্তব সংখ্যার ছবি। কোলাহলপূর্ণ পরিস্থিতিতে MNIST-এর চেয়ে এটি একটি কার্যকর উন্নত ব্যবস্থা।
- ৭৪ হাজার অক্ষর — প্রাকৃতিক ছবি এবং কম্পিউটার ফন্ট থেকে নেওয়া ইংরেজি ও কন্নড় অক্ষর সম্বলিত ৭৪,১০৭টি ছবি।
- NIST বিশেষ ডেটাবেস 19 — ৩,৬০০ জন লেখকের হাতে লেখা ৮,১০,০০০-এরও বেশি অক্ষরের ছবি। অনেক ইংরেজি ওসিআর বেঞ্চমার্ক এর উৎস হিসেবে ব্যবহৃত হয়।
OCR-এর জন্য সেরা হস্তাক্ষর ডেটাসেটগুলো কী কী?
হস্তাক্ষর ডেটাসেটগুলি কারসিভ, মুদ্রিত এবং ঐতিহাসিক হস্তলিখিত পাঠ্য পড়ার জন্য OCR মডেলগুলিকে প্রশিক্ষণ দেয়। সবচেয়ে শক্তিশালী উন্মুক্ত হস্তাক্ষর ডেটাসেটগুলি হস্তলিখিত পাঠ্য শনাক্তকরণের (HTR) জন্য সর্বাধিক উদ্ধৃত বেঞ্চমার্ক হিসাবে রয়ে গেছে।
- আইএএম হস্তাক্ষর ডেটাবেস — ৬৫৭ জন লেখকের ১৩,৩৫৩টি টেক্সট লাইন নিয়ে গঠিত, যা ইংরেজি হস্তাক্ষরের স্বর্ণমান। ২০২৪-২০২৫ সালের ওসিআর গবেষণায় এটি এখনও পর্যন্ত সবচেয়ে বেশি উদ্ধৃত হস্তাক্ষর ডেটাসেট।
- আইএএম-অনডিবি — IAM-এর অনলাইন পেন-স্ট্রোক সংস্করণ, যা গতিপথের ডেটা ধারণ করে। স্টাইলাস এবং ট্যাবলেট শনাক্তকরণের জন্য এটিই প্রামাণ্য হস্তাক্ষর ডেটাসেট।
- বেন্থাম পেপারস — দার্শনিক জেরেমি বেন্থামের প্রতিলিপিকৃত ঐতিহাসিক ইংরেজি পাণ্ডুলিপি। ঐতিহাসিক হস্তাক্ষর OCR-এর শীর্ষস্থানীয় মানদণ্ড, যা Transkribus-এর মাধ্যমে পাওয়া যায়।
- জিএনএইচকে (গুডনোটস হ্যান্ডরাইটিং কোলেশন) — এটি ২০২১ সালের একটি ডেটাসেট, যেখানে রয়েছে সীমাবদ্ধতাহীন বাস্তব জগতের হাতে লেখা ইংরেজি নোট। এটি ল্যাবের মতো নিখুঁত IAM-এর চেয়ে বরং অগোছালো প্রোডাকশন ডেটার বেশি কাছাকাছি।
সেরা বহুভাষিক এবং অ-ল্যাটিন OCR ডেটাসেটগুলো কী কী?
বহুভাষিক ওসিআর ডেটাসেটগুলো ইংরেজি ছাড়াও চীনা, আরবি এবং গাণিতিক লিপিসহ অন্যান্য লিপির ওপর মডেলকে প্রশিক্ষণ দেয়। বিশ্বব্যাপী নথি ও হস্তাক্ষর শনাক্তকরণের জন্য এগুলো অপরিহার্য।
- CASIA-HWDB — এটি চীনা OCR-এর আদর্শ মানদণ্ড, যেখানে ১,০২০ জন লেখকের লেখা ১১.৭ লক্ষ হস্তলিখিত অক্ষরের নমুনা ব্যবহার করা হয়েছে।
- খাট — ১,০০০ জন স্বতন্ত্র লেখকের লেখা ১,০০০টি আরবি হস্তলিখিত ফর্ম, যা একাধিক রেজোলিউশনে স্ক্যান করা হয়েছে। এটি সবচেয়ে ব্যাপক উন্মুক্ত আরবি ওসিআর ডেটাসেট।
- ক্রোম — অনলাইন হস্তলিখিত গাণিতিক রাশিমালা শনাক্তকরণ প্রতিযোগিতা: ১০১টিরও বেশি গাণিতিক প্রতীক জুড়ে ১০,০০০টিরও বেশি রাশিমালা, অনলাইন এবং অফলাইন উভয় সংস্করণে। হস্তলিখিত সমীকরণের OCR-এর জন্য অপরিহার্য।
বিনামূল্যে OCR ডেটাসেট ব্যবহার করার সময় সাধারণ সমস্যাগুলো কী কী?
তিনটি ফাঁদে বেশিরভাগ দলই আটকা পড়ে।
ডোমেইন অমিল: ক্লিন আইএএম (Clean IAM) বা কোকো-টেক্সট (COCO-Text)-এর উপর প্রশিক্ষণ নিয়ে তা কুঁচকানো ইনভয়েসে প্রয়োগ করলে নির্ভুলতার ঘাটতি নিশ্চিত।
লাইসেন্স অন্ধত্ব: বেশ কিছু দৃশ্য-পাঠ্য এবং ঐতিহাসিক ওসিআর ডেটাসেট শুধুমাত্র গবেষণার জন্য অথবা বাণিজ্যিক ব্যবহারের আগে নিবন্ধনের প্রয়োজন হয়।
টীকার ফাঁক: অনেক OCR ডেটাসেটে লেআউট মেটাডেটা, লাইন-লেভেল বাউন্ডিং বক্স বা ফিল্ড লেবেলের অভাব থাকে, যা প্রোডাকশন সিস্টেমের প্রয়োজন হয়।
ধরুন, একটি মাঝারি আকারের লজিস্টিকস ফার্ম শিপিং-লেবেল পড়া স্বয়ংক্রিয় করছে। সাধারণ মানুষের জন্য দৃশ্য-পাঠ্য প্রশিক্ষণের মাধ্যমে তারা নির্ধারিত মানদণ্ডে ৮০% সাফল্য পায়, কিন্তু আলোর ঝলকানি ও ভাঁজযুক্ত আসল লেবেলের কারণে সেই হার কমে ৫৮%-এ নেমে আসে। এই ব্যবধান পূরণের জন্য প্রয়োজন ছিল সুনির্দিষ্ট কর্মপন্থা। ডেটা টীকা লঞ্চের আগে ৬,০০০ ইন-ডোমেইন লেবেল ইমেজ।
ওপেন-সোর্স ডেটাসেটের সুবিধা এবং চ্যালেঞ্জ
ব্যবসায়িকদের তাদের এমএল অ্যাপ্লিকেশানগুলির জন্য বিনামূল্যে-টু-ব্যবহারের ডেটা বেছে নিতে হবে কিনা তা বোঝার জন্য একে অপরের বিরুদ্ধে বেনিফিট এবং চ্যালেঞ্জগুলিকে পিট করতে হবে।
উপকারিতা
- ডেটা সহজেই অ্যাক্সেস করা যায়। ডেটা উপলব্ধতার কারণে, অ্যাপ্লিকেশনটি বিকাশের খরচ উল্লেখযোগ্যভাবে হ্রাস পেয়েছে।
- ডেটাসেট সহজে উপলব্ধ হওয়ায় অ্যাপ্লিকেশনের জন্য ডেটা সংগ্রহ করার সময় এবং প্রচেষ্টা উল্লেখযোগ্যভাবে হ্রাস পেয়েছে।
- প্রচুর কমিউনিটি ফোরাম বা সহায়তা গোষ্ঠী রয়েছে যা ডেটাসেট শিখতে, মানিয়ে নিতে এবং অপ্টিমাইজ করতে সাহায্য করে।
- ওপেন-সোর্স ডেটাসেটের একটি প্রধান সুবিধা হল এটি কাস্টমাইজেশনের উপর কোন সীমাবদ্ধতা রাখে না।
- ওপেন-সোর্স ডেটা জনসংখ্যার একটি বড় অংশের কাছে অ্যাক্সেসযোগ্য, আর্থিক বাধা ছাড়াই বিশ্লেষণ এবং উদ্ভাবন সম্ভব করে তোলে।
চ্যালেঞ্জ
- প্রকল্পের নির্দিষ্ট ডেটা অর্জন করা কঠিন। উপরন্তু, তথ্য অনুপস্থিত এবং উপলব্ধ ডেটার ভুল ব্যবহারের সম্ভাবনা রয়েছে।
- মালিকানা তথ্য অর্জন করতে সময় লাগে, এবং প্রচেষ্টা এবং ব্যয়বহুল
- যদিও ডেটা অর্জন করা সহজ হতে পারে, জ্ঞান এবং বিশ্লেষণের খরচ প্রাথমিক সুবিধার চেয়ে বেশি হতে পারে।
- অন্যান্য বিকাশকারীরাও অ্যাপ্লিকেশনগুলি বিকাশ করতে একই ডেটা ব্যবহার করে।
- এই ডেটাসেটগুলি নিরাপত্তা লঙ্ঘন, গোপনীয়তা এবং সম্মতির জন্য অত্যন্ত ঝুঁকিপূর্ণ।
Shaip কীভাবে OCR এবং হস্তাক্ষর শনাক্তকরণ প্রকল্পগুলোকে সমর্থন করে?
শাইপ'স OCR প্রশিক্ষণ ডেটা পরিষেবা ওপেন-ডেটা সেট কিউরেশনকে কাস্টমের সাথে যুক্ত করুন তথ্য সংগ্রহ ৬০টিরও বেশি ভাষায়, মুদ্রিত নথি, হস্তাক্ষর, রসিদ এবং আইডি সহ। শাইপের অ্যানোটেশন ওয়ার্কফ্লো এমন সব লেয়ার যোগ করে যা পাবলিক ওসিআর ডেটাসেটে থাকে না: লাইন-লেভেল বাউন্ডিং বক্স, ফিল্ড-লেভেল লেবেল, ট্রান্সক্রিপশন কিউসি এবং লেখকের মেটাডেটা।
উপসংহার
উপরের ২২টি OCR ডেটাসেট আপনাকে ২০২৬ সালের জন্য ডকুমেন্ট, সিন টেক্সট, ডিজিট, হস্তাক্ষর এবং বহুভাষিক শনাক্তকরণের ক্ষেত্রে একটি সম্পূর্ণ ওপেন-সোর্স ভিত্তি প্রদান করে। আপনার টেক্সটের ধরন এবং ক্যাপচার পরিবেশের সাথে মেলে এমন OCR ডেটাসেট দিয়ে শুরু করুন, আপনার আসল ডেটার একটি সংরক্ষিত নমুনার সাথে যাচাই করুন, এবং ডোমেইনের ঘাটতি পূরণের জন্য কাস্টম অ্যানোটেশনের জন্য বাজেট রাখুন। এই সমন্বয়টি একেবারে গোড়া থেকে তৈরি করার চেয়ে দ্রুত সরবরাহ করা যায়।
মেশিন লার্নিংয়ের জন্য সেরা বিনামূল্যের ওসিআর ডেটাসেট কোনটি?
সেরা বিনামূল্যের OCR ডেটাসেটটি কাজের ধরনের উপর নির্ভর করে। সিন টেক্সটের ক্ষেত্রে ICDAR Robust Reading, ডকুমেন্ট ও রসিদের OCR-এর ক্ষেত্রে FUNSD ও SROIE এবং হস্তাক্ষরের ক্ষেত্রে IAM এগিয়ে আছে। সংখ্যা শনাক্তকরণের জন্য MNIST এবং SVHN হলো আদর্শ। বেশিরভাগ দল একটির উপর নির্ভর না করে বিভিন্ন বিভাগের দুই বা তিনটি OCR ডেটাসেট একত্রিত করে ব্যবহার করে।
ওপেন-সোর্স ওসিআর ডেটাসেটগুলো কি বাণিজ্যিক ব্যবহারের জন্য বিনামূল্যে পাওয়া যায়?
ওপেন-সোর্স ওসিআর ডেটাসেটগুলোর সবগুলোই বাণিজ্যিক ব্যবহারের জন্য বিনামূল্যে নয়। MNIST, SVHN, এবং COCO-Text উদার লাইসেন্স ব্যবহার করে, অন্যদিকে IAM, ICDAR সেট এবং ঐতিহাসিক হস্তাক্ষর ডেটাসেটগুলোর জন্য প্রায়শই নিবন্ধনের প্রয়োজন হয় অথবা এগুলোর ব্যবহার গবেষণার মধ্যে সীমাবদ্ধ থাকে। কোনো বাণিজ্যিক মডেলকে প্রশিক্ষণ দেওয়ার আগে সর্বদা প্রতিটি ডেটাসেটের লাইসেন্স পর্যালোচনা করুন।
OCR ডেটাসেট এবং হস্তাক্ষর ডেটাসেটের মধ্যে পার্থক্য কী?
OCR ডেটাসেটগুলো মুদ্রিত নথি, দৃশ্যমান পাঠ্য এবং সংখ্যাসহ সমস্ত মেশিন-পাঠযোগ্য পাঠ্য শনাক্তকরণকে অন্তর্ভুক্ত করে, অন্যদিকে হস্তাক্ষর ডেটাসেটগুলো হলো হস্তলিখিত বিষয়বস্তুর উপর বিশেষভাবে আলোকপাতকারী উপসেট। IAM এবং Bentham-এর মতো হস্তাক্ষর ডেটাসেটগুলো HTR মডেলকে প্রশিক্ষণ দেয়, অপরদিকে নথি এবং দৃশ্যমান পাঠ্য OCR ডেটাসেটগুলো মুদ্রিত এবং বাস্তব জগতের পাঠ্য পরিচালনা করে।
কোন OCR ডেটাসেটগুলো বহুভাষিক শনাক্তকরণ সমর্থন করে?
বহুভাষিক OCR ডেটাসেটগুলোর মধ্যে রয়েছে সাতটি ভাষার ফর্মের জন্য XFUND, চীনা ভাষার জন্য CASIA-HWDB, আরবি ভাষার জন্য KHATT এবং বহুভাষিক সিন টেক্সটের জন্য ICDAR MLT। স্ক্রিপ্ট-নির্দিষ্ট OCR ডেটাসেটগুলোকে সিন্থেটিক অগমেন্টেশনের সাথে একত্রিত করলে সাধারণত যেকোনো একটি ডেটাসেটের উপর এককভাবে প্রশিক্ষণের চেয়ে ভালো ফলাফল পাওয়া যায়।
বিনামূল্যের OCR ডেটাসেটগুলোর বাইরে আমার আর কী পরিমাণ কাস্টম অ্যানোটেশন প্রয়োজন?
আপনার ডকুমেন্টগুলো পাবলিক ডেটা থেকে কতটা দূরে, তার উপর কাস্টম অ্যানোটেশনের প্রয়োজনীয়তা নির্ভর করে। পরিষ্কার মুদ্রিত ফর্মের জন্য ১,০০০–৫,০০০ ইন-ডোমেইন স্যাম্পলের প্রয়োজন হতে পারে, যেখানে অগোছালো হাতের লেখা, রসিদ বা বিরল লিপির জন্য প্রায়শই ১০,০০০–৫০,০০০ স্যাম্পল লাগে। শাইপ-এর অ্যানোটেশন পাইপলাইনগুলো সাধারণত শুধুমাত্র পাবলিক ওসিআর প্রশিক্ষণের তুলনায় ১৫–৩০% বেশি নির্ভুলতা প্রদান করে।



