ٹیکسٹ شناخت سافٹ ویئر OCR کے بارے میں بات کرتے ہوئے
ہم شینزین چین میں ایک بڑی پرنٹنگ کمپنی ہیں. ہم تمام کتاب کی اشاعتیں، ہاکیورور کتاب پرنٹنگ، پیپرکور کتاب پرنٹنگ، ہارڈکورٹ نوک بکس، سپائلڈ کتاب پرنٹنگ، سیڈل سٹچنگ کتاب پرنٹنگ، کتابچہ پرنٹنگ، پیکیجنگ باکس، کیلنڈر، پیویسی، تمام بروشر، مصنوعات کی بروچ، نوٹ، بچوں کی کتاب، اسٹیکرز، تمام پیشکش کرتے ہیں. خاص کاغذ رنگ پرنٹنگ کی مصنوعات کی طرح، کھیل cardand اسی طرح.
مزید معلومات کے لئے ملاحظہ کریں
http://www.joyful-printing.com. صرف ENG
http://www.joyful-printing.net
http://www.joyful-printing.org
ای میل: info@joyful-printing.net
چینی کردار کی شناخت سافٹ ویئر کا کام یہ ہے کہ کس طرح کمپیوٹر "ادب" بنانے کا طریقہ مطالعہ کرے. یہ نظام عام طور پر ایک فوٹو ویکٹر تبادلوں والے آلہ کا استعمال کرتی ہے جس میں چینی کردار یا ایک لفظ باکس کو الیکٹرانک سگنل میں تبدیل کر دیا جاتا ہے، اور اسے کمپیوٹر میں بھیجتا ہے، جو خود کار طریقے سے تسلیم شدہ اور کمپیوٹر کے ذریعہ پڑھا جاتا ہے، لہذا اسے نظریہ کہا جاتا ہے. اپٹیکل کردار کی شناخت (او سی آر).
او سی آر کی ترقی کی پروفائل
او آر سی کا تصور پہلے سب سے پہلے 1 929 میں جرمن سائنسدان تاشوک نے پیش کیا تھا. بعد میں، امریکی سائنسدان ہینڈل نے بھی الفاظ کو شناخت کرنے کے لئے ٹیکنالوجی کا استعمال کرنے کا خیال پیش کیا. پرنٹ شدہ چینی حروف کی شناخت پر ابتدائی تحقیقات آئی بی ایم کیسی اور ناجی تھے. 1 9 66 میں، انہوں نے چینی کردار کی شناخت پر پہلا مضمون شائع کیا، جس نے 1000 طباعت شدہ چینی حروف کی شناخت کے لئے ٹیمپلیٹ مماثلت کا استعمال کیا. 1970 کی دہائی کے آغاز میں، جاپانی علماء نے چینی کردار کی شناخت کا مطالعہ شروع کیا اور بہت سے کام کئے. چین میں چینی کردار کی شناخت پر تحقیق نسبتا دیر سے شروع ہوئی، اور 1970 ء کے آخر میں او آر سی کے تحقیقاتی کام شروع ہوا. ابتدائی او سی آر سافٹ ویئر کو مختلف عوامل کی وجہ سے تسلیم کی شرح اور پیداوار کے مطابق اصل ضروریات کو پورا کرنے میں ناکام رہی. ایک ہی وقت میں، ہارڈ ویئر کا سامان اور سست آپریشن کی تیز رفتار کی وجہ سے، یہ عملی سطح تک نہیں پہنچا ہے. صرف چند محکموں، جیسے معلومات محکموں، پریس اور اشاعت یونٹس، OCR سافٹ ویئر کا استعمال کریں. 1986 کے بعد، چین کے او آر سی ریسرچ نے بہت ترقی کی ہے، اور اس نے چینی کردار ماڈلنگ اور شناخت کے طریقوں میں بدعت بنا دی ہے. اس نے نظام کی ترقی اور ترقیاتی ایپلی کیشنز میں پھل انگیز نتائج حاصل کیے ہیں. بہت سے یونٹس نے چینی او سی آر کی مصنوعات کو کامیابی سے شروع کیا ہے. 1 99 0 کے بعد، چین میں پلیٹ فارم اسکینرس کی وسیع درخواست اور معلومات آٹومیشن اور دفتری آٹومیشن کی مقبولیت کے ساتھ، او سی آر ٹیکنالوجی کے مزید ترقی کو فروغ دیا گیا ہے، اور او سی آر کی شناخت کی شرح کو تسلیم کیا گیا ہے، اور تسلیم کی رفتار کو مطمئن کردیا گیا ہے صارفین. دعوی کریں
اس وقت، بہت سے مقبول او سی آر سافٹ ویئر موجود ہیں. انگریزی OCR میں OmniPage، چینی OCR، بنیادی طور پر Tsinghua Unisplendour OCR، Tsinghua Wentong او سی آر، ہونونگ OCR، Zhongjing Shangshu OCR، Danqing او سی آر، اور Mengyu OCR شامل ہیں. چینی حروف اور پیچیدہ فانٹ کے باوجود، او سی آر ٹیکنالوجی نے طے کیا ہے. بہت سے او سی آر سافٹ ویئر نہ صرف سیاہ اور سفید چھپی ہوئی چینی حروف کو تسلیم کرسکتے ہیں بلکہ چینی حروف کو رنگنے اور رنگوں کو بھی تسلیم کرتے ہیں. تسلیم کی رفتار تیز ہے اور تسلیم کی درستگی کی شرح 99 فیصد سے زائد ہے. یہ مختلف فونٹس جیسے نغمہ، بولڈ، اور سکورین کو تسلیم کر سکتے ہیں. روایتی؛ مختلف فانٹ، مختلف فونٹ سائز اختلاط کو تسلیم کر سکتے ہیں؛ کچھ او سی سی سافٹ ویئر بھی تصاویر، ٹیبلوں کی شناخت کرسکتے ہیں. ایک ہی وقت میں، لامحدود چینی کردار کی شناخت کے مطالعہ میں بہت بڑی پیش رفت کی گئی ہے، اور درست تسلیم کی شرح 70 فیصد سے زائد تک پہنچ گئی ہے.
او سی آر سافٹ ویئر کی درخواست
سکینر مارکیٹ میں، دفتر اور گھر سکینرز کے بہت سے اقسام OCR سافٹ ویئر سے لیس ہیں. مثال کے طور پر، وایلیٹ سکینر وایلیٹ او سی آر سے لیس ہے، کرسٹل سکینر Shangshu OCR سے لیس ہے، اور Mustek سکینر Danqing او سی آر کے ساتھ لیس ہے. سکینر اور او سی سی سافٹ ویئر نے پورے عمل کو دستاویز کے ان پٹ سے ٹیکسٹ شناخت میں حصہ لیا.
دستاویز کا سکیننگ اکثر آفس کے میدان میں استعمال کیا جاتا ہے. اخبارات، میگزین وغیرہ میں اشاعتوں سے متعلق دستاویزات سکینر کی طرف سے سکینڈ ہیں، اور پھر OCR کی شناخت کی گئی ہے، یا تصویر فائل کے طور پر ذخیرہ کیا جاتا ہے، بعد میں او سی آر کی شناخت کے لئے، اور تصویر کی فائلوں کو متن میں تبدیل کر دیا جاتا ہے. اسٹوریج کیلئے فائل یا ورڈ فائل.
اس کے علاوہ، ڈیجیٹل معلومات کی اسٹوریج اور ٹرانسمیشن صرف لاگت میں کم نہیں ہے، کارکردگی میں زیادہ ہے بلکہ قسم کی قسم اور نیٹ ورک ٹرانسمیشن کی غیر ضروری ضرورتوں کے مطابق بھی قابل اطلاق ہے. فی الحال، چین میں بائیں جانب کتابوں، اخبارات، میگزینوں اور بہت کاغذی خزانے موجود ہیں، اور انہیں الیکٹرانک معلومات میں تبدیل کرنے کے لئے یہ ضروری ہے. مثال کے طور پر، ایک الیکٹرانک لائبریری کا قیام کرنے کی ضرورت ہوتی ہے کہ کتابوں کے صفحے پر صفحہ سکین کیا جائے، اور او سی سی سافٹ ویئر کی شناخت الفاظ کے دستی ٹائپنگ کی جگہ لے لے، جس میں داخلہ کے وقت کو بہت کم کرنا، مزدور کی شدت کم ہوجاتا ہے، انسان کو بچاتا ہے اور اخراجات کو کم کرتا ہے. داخلہ، کام کی کارکردگی اور جدید آفس آٹومیشن کی درستگی کو بہتر بنائیں.
فی الحال، OCR سافٹ ویئر اور اسکینرز کا مجموعہ معلومات کی عمر کے بہت سے شعبوں، جیسے ڈیجیٹل لائبریریوں، مختلف رپورٹس کی شناخت، اور بینکنگ اور ٹیکس کے نظام کے معیار کی شناخت پر لاگو کیا گیا ہے. نیٹ ورک اور معلومات کی ترقی اور مقبولیت کے ساتھ، اس کی درخواست کا گنجائش زیادہ سے زیادہ وسیع ہو جائے گا.
او آر سی کے نظام کی تشکیل
چینی کردار کی شناختی سافٹ ویئر OCR کی تقریب کو مختلف چینی گرافکس یا چینی حروف، پرنٹس یا ہاتھوں سے لکھا جاتا ہے اور چینی کردار کے زمرے کے کوڈ کو نشان زد کرنے میں ہر چینی کردار کی تصاویر کو تسلیم کرنا ہے. لہذا، چینی کردار کی شناخت بالآخر ایک تصویر کی شناختی مسئلہ ہے. چینی حروف کی ایک بڑی مقدار کی وجہ سے، مختلف فونٹس، فونٹس اور پیچیدہ ڈھانچے، چینی کردار کی شناخت کے عمل کو بہت پیچیدہ ہے. جیسا کہ او آر سی سافٹ ویئر کے کام کے بہاؤ کی منصوبہ بندی کی آیات، جیسا کہ مندرجہ ذیل ٹیبل میں دکھایا گیا ہے:
دستاویز کے اعداد و شمار → اسکین ان پٹ → تصویر پروسیسنگ → ترتیب ڈویژن → متن کی شناخت → ٹیکسٹ ایڈیٹنگ → دستاویز سٹوریج
مقبولیت اور سکینرز کی وسیع اطلاق کی وجہ سے، او سی آر سافٹ ویئر کو صرف سکینر کے ساتھ ایک انٹرفیس فراہم کرنے اور سکینر ڈرائیور سافٹ ویئر کا استعمال کرنے کی ضرورت ہے. لہذا، OCR سافٹ ویئر بنیادی طور پر ایک تصویر پروسیسنگ ماڈیول، ایک ترتیب ڈویژن ماڈیول، ٹیکسٹ شناخت ماڈیول، اور ایک متن میں ترمیم کے ماڈیول سے مشتمل ہے.
1. تصویری پروسیسنگ ماڈیول
تصویر پروسیسنگ ماڈیول میں بنیادی طور پر دستاویزات سکیننگ، تصویر سکیننگ، اور تصویر گردش جیسے افعال ہیں. سکینر کی طرف سے ان پٹ کے بعد، دستاویز ایک تصویر فائل تشکیل دیتا ہے، اور تصویر پروسیسنگ ماڈیول داغ اور خروںچ کو ہٹانے کے لئے تصویر کو بڑھا سکتا ہے. اگر تصویر درست طریقے سے گھوم نہیں ہے تو، متن کی شناخت کے لئے بہتر حالات پیدا کرنے کے لئے، تصویر کو دستی طور پر یا خود بخود گھومنے کی جا سکتی ہے. شناخت کی شرح زیادہ ہے.
2. لے آؤٹ ڈویژن
لے آؤٹ ڈویژن ماڈیول میں ترتیب میں تقسیم ڈویژن اور تبدیلی ڈویژن شامل ہے، جو ترتیب، لفظ تقسیم، معمولی، وغیرہ کے بارے میں سمجھا جاتا ہے، اور خود کار طریقے سے یا دستی ترتیب منتخب کیا جاسکتا ہے. مقصد یہ ہے کہ او آر سی سافٹ ویئر کو ایک ہی ترتیب میں مضامین، میزیں، اور وغیرہ کو علیحدہ کرنے کے بارے میں بتائے، تاکہ وہ علیحدہ طریقے پر عملدرآمد کی جاسکیں اور کس ترتیب میں.
3. متن کی شناخت ماڈیول
متن کی شناخت ماڈیول OCR سافٹ ویئر کا ایک بنیادی حصہ ہے، جیسا کہ ذیل میں دکھایا جاتا ہے، ایک آسان متن کی شناخت کے عمل کی آراگرام. متن کی شناخت ماڈیول بنیادی طور پر ان پٹ چینی حروف پر "پڑھنے" انجام دیتا ہے، لیکن یہ کثیر لائن نہیں ہوسکتی ہے اور قطار کی طرف سے لائن کو کاٹنا ہوگا. چینی حروف کے لئے، یہ عام طور پر ایک لفظ اور ایک لفظ کی طرف سے تسلیم کیا جاتا ہے، یہ، ایک لفظ کی شناخت، اور پھر عام طور پر. متن کی شناخت ماڈیول مختلف نمونہ چینی حروف کی خصوصیات کو نکالتا ہے، تسلیم مکمل کرتا ہے، خود کار طریقے سے مشکوک لفظ ڈھونڈتا ہے، اور اس کے افعال سے پہلے اور اس کے بعد کام کرتا ہے.
ان پٹ اصل → لائن کاٹنے → لفظ کاٹنے → قدرتیization → شناخت کی خصوصیت نکالنے → لفظ کی شناختی ï ¿
└- → پری درجہ بندی کی خصوصیت کی خصوصیت → خصوصیت لائبریری (ڈکشنری) → آؤٹ پٹ مینیو سکرپٹ
4. متن ترمیم ماڈیول
ٹیکسٹ ایڈیٹنگ ماڈیول بنیادی طور پر او سی آر کے تسلیم کردہ متن کو ترمیم اور ترمیم کرتا ہے. اگر نظام کو تسلیم کیا جاتا ہے کہ یہ غلط ہے، متن بولڈ سرخ یا نیلے رنگ میں دکھایا جائے گا، اور انتخاب کے لئے ایک ہی متن فراہم کرے گا، اور پیداوار کے لئے ایڈیٹر کو منتخب کریں.
OCR سافٹ ویئر کا استعمال کیسے کریں
اگرچہ بہت سے قسم کے او سی آر سافٹ ویئر ہیں، ان کا استعمال اسی طرح کی ہے. پہلا قدم دستاویز کو اسکین کرنا ہے اور پھر OCR کی شناخت کرنا ہے. OCR سافٹ ویئر کا استعمال مندرجہ ذیل ہے:
1. دستاویز سکیننگ
متن کی شناخت کے لئے OCR سافٹ ویئر استعمال کرنے کے لئے، دستاویزات کو براہ راست OCR سافٹ ویئر میں سکینڈ کیا جا سکتا ہے. او سی سی سافٹ ویئر چلانے کے بعد، او سی سی سافٹ ویئر انٹرفیس ظاہر ہوگا.
سکینر کے شیشے کی جانب سے اسکین ہونے کے لئے دستاویز کو رکھیں تاکہ سکینڈ کی جانب سے دستاویز کا سب سے اوپر اختتام کے ساتھ سکینر کے شیشے کی طرف چھا جاتا ہے، حکمرانی کے کنارے سے منسلک ہوتا ہے، اور پھر سکینر ہے. سکیننگ کے لئے تیار کرنے کے لئے احاطہ کرتا ہے. سکیننگ کے لئے سکین ڈرائیور سافٹ ویئر درج کرنے کے لئے ونڈو میں "سکین" بٹن پر کلک کریں. سکیننگ کا طریقہ یہاں بیان نہیں کیا جائے گا. تاہم، یہ غور کرنا چاہئے کہ قرارداد 200 ~ 400 ڈیپیپی پر مقرر کیا جاسکتا ہے. ٹیکسٹ دستاویزات کے لئے، چمک کو ایڈجسٹ کرنا ضروری ہے.
2. OCR کی شناخت
آپریشن کے آسان کے لۓ، مینو سے اختیارات منتخب کریں اور مختلف شبیہیں کھڑکی کے بائیں طرف دکھائیں.
بہتر استعمال کے لئے، سب سے پہلے آئکن کو متعارف کرایا اسکرین کے بائیں طرف سے اوپر سے نیچے سے:
"زوم میں" کے آلے: تصویر کو بڑھانے کے لئے؛ "زوم آؤٹ" کے آلے: تصویر کو کم کرنے کے لئے؛ "شناختی علاقے قائم کریں" کا آلہ: شناختی علاقے کو قائم کرنے کے لئے؛ "شناخت آرڈر کی ترتیب" کے آلے: شناختی حکم کی ترتیب کے لۓ؛ شناخت ایریا کے آلے کو حذف کریں: شناختی علاقے کو حذف کرنے کے لئے؛ "تصویری شور کو ختم کریں" کے آلے: تصویر میں کسی علاقے کو ختم کرنے کے لئے؛ "تصویر گھومائیں" کا آلہ: تصویر کو 90 °، 180 ° یا 270 ° گھومنے کے لۓ؛ جھٹکا اصلاح کا آلہ: دستی تصویر جھگڑا اصلاح کے لئے.
OCR کی شناخت کے لئے عام اقدامات:
(1) دستاویز کے بعد اسکین کیا جاتا ہے، متن کو تسلیم کیا جا سکتا ہے کہ ونڈو میں ظاہر ہوتا ہے بہت چھوٹا ہے. سب سے پہلے، تصویر کو مزید واضح بنانے کے لئے مناسب طریقے سے تصویر بڑھانے کے لئے "زوم ان" کا آلہ منتخب کریں. اگر ضروری ہو تو، آپ مناسب طریقے سے اسکرین کے سائز کو کم کرنے کے لئے "زوم آؤٹ" کا آلہ منتخب کرسکتے ہیں.
(2) اگر اسکرین کو 90 °، 180 ° یا 270 ° سے گھومنے کی ضرورت ہے، تو تصویر کو گھومنے کے لئے گھومنے والی تصویر کا آلہ استعمال کریں. اگر ٹیکسٹ اسکرین کو پھیلایا جاتا ہے تو، اسکرین کو ایڈجسٹ کرنے کے لئے ٹائل اصلاح سازی کا آلہ منتخب کریں.
(3) شناخت کے دوران "شناختی علاقے کو منتخب کریں" کے آلے کو منتخب کریں، اور اسکرین اسکرین پر تسلیم کرنے کے علاقے کو فریم کریں. اس صورت میں، اسکرین کی حالت کے مطابق متعدد علاقوں کو فریم بنایا جا سکتا ہے. اگر فریم شدہ علاقے غلط ہے تو، آپ منتخب شدہ علاقے کو حذف کرنے کے لئے حذف کرنے کی شناختی ایریا کے آلے کا استعمال کرسکتے ہیں.
(4) شناخت کی شرح کو بہتر بنانے کے لئے، اگر منتخب شدہ شناخت کے علاقے میں شور یا ناقابل قابل تصویری تصویر ہے تو، شور کی بٹ کو ختم کرنے کیلئے "تصویری شور شور" کا آلہ منتخب کیا جا سکتا ہے. اگر آپ کو ٹکڑے ٹکڑے میں مٹانے کی ضرورت ہوتی ہے تو، آپ کو تصویری بلاک کے آلے کا مسح منتخب کر سکتے ہیں.
(5) "شناخت" آئیکن پر کلک کریں، پھر او سی آر ڈسپلے متن کے حصول کی کارکردگی کا مظاہرہ کر رہا ہے، پھر "شناخت" اسکرین میں منتقل ہوتا ہے، اور تسلیم شدہ ٹیکسٹ قدم قدم کی طرف سے قدم دکھایا جائے گا، اور اس کے بعد "دستاویز پروففرق" ونڈو میں منتقل دکھایا گیا.
بہت سے او سی آر سافٹ ویئر میں ایک متن میں ترمیم کی تقریب ہے جو متن کو تسلیم کرتی ہے جو غلط ہوسکتی ہے، واضح رنگ میں ظاہر ہوتا ہے اور نظر ثانی کی جا سکتی ہے.
(6) ایک تسلیم شدہ فائل کو ایک ٹیکسٹ (TXT) فائل یا ورڈ آرٹیکل فائل کے طور پر ذخیرہ کریں.

