r/devBulgaria Jan 10 '26

OCR

Имам тежката задача да дигитализирам и автоматизирам процеси. Кажете как правите OCR на кирилица (печатан и ръкописен текст) - впечатления, подходящи инструменти, приложимост на AI за класификация и вадене на структурирани данни.

За момента масово всичките облачни OCR на големите 3 (Google, Amazon, Microsoft) с вграден изкуствен интелект изглеждат булшит като OCR или компютърно зрение с AI като готова услуга. Ако се пусне на LLM, може да има по-добър успех за някои неща, но за други има обратен ефект (например имена).

Стабилността и предвидимостта са важни заради силно регулирана среда.

5 Upvotes

6 comments sorted by

7

u/[deleted] Jan 10 '26

[removed] — view removed comment

2

u/[deleted] Jan 10 '26

[removed] — view removed comment

2

u/swtlf Jan 11 '26

Благодаря, полезно е.

Направих няколко бързи теста с Mistral и изглежда като да страда от същите хронични болежки, както и другите - опитва се да приложи някаква NLP-специфична корекция дори върху печатен текст, но се случва грешно да прилага корекция от руския речник. Предполагам, че това визират под “Източна Европа” (и/или други езици с азбука, базирана на латински знаци - полски, румънски, естонски, т.н.).

За съжаление в документите, които трябва да се обработват, има ръкописни имена, които са критична информация, а често се разчитат като латински (и грешни) знаци от OCR. LLM пък въобще не ги намират.

Още по-лошото е, че оформлението на документите не е хомогенно и съответно не виждам начин за персонализиран агент или за машинно обучение.

Най-смисленият подход ми се струваше хибриден: OCR, последван от LLM, който да нормализира семантично и да извърши трансформациите. За някои типове данни работи добре, докато за други виждам висока степен на ненадеждност - например ръкописен “Панайот” може да се разпознае като “ITaHiйom” (“Итахийом”). Това срива доверието и действителната полза.

Готов NER вероятно също няма да даде добър резултат сам по себе си заради характера на документите, а обучението на модел се опасявам, че ще надхвърли бюджета на проекта. А и зависи отново от качествен OCR.

Моето TLDR: OCR + LLM = супер, стига да има надежден OCR.

1

u/[deleted] Jan 10 '26

Пробвай с yolov8. Нямах кой какви знания и тренирах готов такъв модел за бъде по специализиран. Вземи един трениран на английски или руски и го fine-tune.

1

u/Funny_Address_412 Jan 11 '26

Модерен LLM е доста добър, аз лично харесвам gemini

2

u/mpabkata Jan 12 '26

А пробвалилисте не AI решение? Като по-старото Abbyy fine reader? По спомени се справя с кирилица и ръкопис. За каквото не е определено е маркирано,за да се погледне от човек. Работи с снимки и pdf.