Forum Romania Inedit
Romania Inedit - Resursa ta de Fun
|
Nou pe simpatie: Profil dela_dela
 | Femeie 24 ani Bucuresti cauta Barbat 24 - 48 ani |
|
|
Forum Romania IneditReguliInregistrareLoginPozeNu sunteti logat. Lista Forumurilor Pe Tematici
|
| #101 |
|
|
Buna ziua, Am un multifunctional Canon Pixma MG5350 cu care am inceput sa scanez carti si ceva documente. Problema e cu foile subtiri, la scanare, peste continutul paginii scanate aparand si ceva continut din pagina din spate. Cum se poate rezolva problema ? Vreau sa fac la finalul prelucrarii imaginilor tiff produse de scanner, folosind Scan Tailor, un fisier pdf din imagini, deci nu voi folosi ocr.
|
|
| |
|
| #102 |
|
|
*** Problema este rezolvabilă, doar că munca de scanare este mai greoaie, dar atunci când doreşti să faci un lucru bun, nimic nu este prea greu. Sunt necesare două coli de hârtie neagră de mărimea paginii cărţii sau mai mare.
Practic, înainte de scanarea unei pagini sau a unei perechi de pagini, trebuie introdusă între fila de scanat şi restul cărţii o coală de hârtie neagră. înseamnă că avem o coală neagră sub pagina din stânga şi o alta sub pagina din dreapta. În acest fel, literele [de culoare neagră] de pe verso se vor pierde în fundalul negru al colii introduse sub pagina de scanat, şi pe imaginea scanată se vor vedea doar literele de pe faţa de scanat, fără a se mai vedea cele de pe verso.
Deci, între paginile de scanat se introduce o coală de hârtie de culoare neagră sau foarte închisă. Ar fi de preferat hârtie neagră, eventual de la ambalajul hârtiei foto. Merge şi un carton bleumarin închis care se poate găsi prin papetării sau măcar o copertă de dosar bleumarin, dosare care se găsesc în mod sigur în papetării.
La început poate părea destul de dificil să tot scoţi şi să pui hârtia neagră între filele cărţii, dar e doar o chestie de puţin antrenament… pe de altă parte, nu e nevoie ca o carte să fie scanată într-o oră sau într-o zi… Poţi scana doar câte un pachet mai mic de pagini în fiecare zi.
Personal am scanat şi două săptămâni la acelaşi volum. E adevărat că era un dicţionar de fo 3 kile, dar dacă vrei, nu există piedici de netrecut. Satisfacţia de la final, a unui lucru bine făcut, merită orice efort.
Ideea este ca munca de digitalizare să fie făcută atunci când avem timp şi plăcere şi ea trebuie să alunge stresul şi nu să fie o sursă de stres. În digitalizare nu trebuie să existe termene sau norme şi mai ales nu trebuie să ne grăbim să lucrăm tone de cărţi. O carte interesantă, bine lucrată, care este citită de cât mai mulţi oameni, este mult mai folositoare decât o sută de cărţi, făcute în grabă, dar pe care nu le citeşte nimeni.
Multă baftă!
|
|
| |
|
| #103 |
|
|
Am scos la imprimanta un carton taiat dintr-un dosar cu sina, in culoarea neagra. Adevarat, cam greu cu scanarea si prelucrarea ulterioara. Trebuie rabdare. Eu unul nu ma bag la ocr, fiindca e munca de titan. Prefer crearea pdf din imagini, dupa o prelucrare k lumea in Scan Tailor. Va multumesc!
|
|
| |
|
| #104 |
|
|
sters. reason: post duplicat.
|
|
| |
|
| #105 |
|
|
Dupa ce fotografiezi toate paginile la o carte le prelucrezi in ocr poza cu poza
|
|
| |
|
| #106 |
|
|
Salut! Am si eu o problema...cum pun alineat la carti in format txt?...am luat niste carti de pe net in engleza si cand le pun pe kindle in format txt se vad fara alineat...de la o margine la cealalta incontinuu.
|
|
| |
|
| #107 |
|
|
Formatul TXT nu suporta formatari de niciun fel.
|
|
| |
|
| #108 |
|
|
Sau daca vreau sa transform in mobi nu mi le face cum trebuie programul calibri...mi le spatiaza aiurea...vreun sfat ceva?
|
|
| |
|
| #110 |
|
|
Multumesc mi-a fost de mare ajutor
|
|
| |
|
| #111 |
|
|
Am citit in topicul COLABORARI - useri activi urmatoarea postare a lui utilitasetveritas:
utilitasetveritas a scris:
Ocr-ul trebuie obtinut din scanarea bruta, nu din imaginile prelucrate ulterior. Totodata se foloseste Abby Finereader pentru ocr, ci nu Adobe sau alt program de gen. |
As fi fost off topic daca as fi postat acolo,asa ca am mutat discutia aici. Deoarece nu stapanesc foarte bine termenii (neavand scaner nu m-am lovit de aceste probleme), am rugamintea sa fie amabil si sa detalieze urmatoarele. - ce inseamna scanare bruta si la ce format se refera - de ce este mai bine sa obtii ocr-ul din scanarea bruta si care ar fi problema daca il obtinem din imagini prelucrate - la ce alt soft se refera cand afirma ca nu este recomandat a fi folosit Multumesc in avans.
|
|
| |
|
| #113 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
ZVONACFIRST a întrebat:
1. ce inseamna scanare bruta si la ce format se refera? 2. de ce este mai bine sa obtii ocr-ul din scanarea bruta si care ar fi problema daca il obtinem din imagini prelucrate? 3. la ce alt soft se refera cand afirma ca nu este recomandat a fi folosit?
Deocamdată încerc să dau un răspuns, o părere personală, la întrebarea #3, deoarece răspunsul este mai simplu. 3. la ce alt soft se refera cand afirma ca nu este recomandat a fi folosit?
Există mai multe softuri care fac recunoaşterea optică a caracterelor dintr-o imagine: cel mai cunoscut şi mai eficient este Abbyy FineReader. Atenţie! a apărut ABBYY FineReader 12 Professional.
Se mai poate face recunoaştere caractere cu alte multe softuri, printre care: PDF Transformer de la Abbyy, Adobe Acrobat, OmniPage, Readiris Pro... [câteva informaţii aici]. În afară de faptul că aceste softuri se găsesc foarte greu şi sunt mult mai scumpe decât Abbyy, ele - de regulă - nu au încorporată în soft şi limba română, fapt pentru care recunoaşterea dă mai multe erori decât Abbyy. În plus Abbyy oferă posibilităţi mai largi de setare: se poate obţine o limbă [2] bazată pe limba de bază, la care se pot adăuga sau scoate caractere etc... prezintă posibilitatea acomodării [antrenamentului] softului cu recunoaşterea caracterelor etc... Am testat de mai multe ori unele dintre softurile alternative [eu personal m făcut mai multe testări cu OmniPage şi Readiris Pro] şi rezultatul a fost net în favoarea Abbyy. Colegul @calincalin a făcut în ultima perioadă mai multe testări cu Acrobat şi Abbyy: rezultatul a fost în favoarea Abbyy.
Cu cât scanarea este de calitate mai slabă şi cartea scanată este mai veche, cu atât se vede mai bine diferenţa de calitate a recunoaşterii caracteror.
Concluzia mea personală: Abbyy 11 este [deocamdată] cel mai bun. Să vedem ce ne oferă Abbyy 12!
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #114 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Întrebarea #1. 1. ce inseamna scanare bruta si la ce format se refera?
Scanarea se poate face direct cu softul Abbyy sau cu un alt soft.
Dau un singur exemplu: imaginile iniţiale - în format JPG - ale cărţii "I.Ludo - Starea de Asediu" scanată de @caluseriu calin are 1,63 GB. După încărcarea lor în Abbyy şi salvarea în acelaşi format [JPG], fără a face crop sau alte prelucrări, noile imagini au în total doar 419 MB, adică sunt de circa 3,89 ori mai mici. Dacă facem o convertire dintr-un format în altul de imagine cu oricare soft prelucrare imagini, majoritatea softurilor pierd câte ceva din caracteristicilor imaginilor. Concluzia este că pe undeva la orice convertire se pierd nişte informaţii, altfel spus, imaginile obţinute sunt cumva mai slabe decât cele iniţiale.
Ţinând cont de aceste lucruri, înseamnă că cea mai bună imagine ar fi cea obţinută direct la scanare. Rezultă că şi cel mai bun OCR se poate obţine din imagininea originală. Pentru ca această concluzie să fie adevărat este nevoie de o condiţie: imaginea scanată să fie splituită.
Avem două variante de scanare la cărţile de format mic şi mijlociu: - o singură imagine pentru cele două pagini, deci pagină dublă pe imagine - imagine nesplitută; - câte o imagine pentru fiecare pagină, o imagine pentru pagina din stânga şi o imagine pentru pagina din dreapta - imagine splituită.
Abbyy, dar şi alte softuri se descurcă mult mai bine la recunoaşterea textului din imaginile splituite. În cazul imaginilor nesplituite poate apărea din când în când ceea ce numim rocada ariilor de recunoaştere a textului. Să dăm un exemplu: În imaginea următoare se observă 6 arii de recunoaştere [suprafeţe care conţin text], dintre care 3 principale, care conţin textul propriu-zis şi 3 secundare care conţin numărul de pagină şi alte informaţii din subsolul paginii; aceste ultime 3 arii pot să nu apară dacă se setează ca Abbyy să nu facă citirea zonelor Header şi Footer. În mod corect, cele 6 zone de text trebuie citite în ordinea următoare:
Cu toate acestea, Abbyy poate stabili din când în când o altă ordine de citire decât cea normală; habar n-am care este motivul, dar situaţiile există; probabil că citeşte mai întâi zonele clare de text şi mai apoi pe cele pentru care are oarece dubii. Ideea este că UNEORI pot fi citite mai întâi una sau mai multe zone din pagina din dreapta şi apoi pe cele din pagina din stânga; pot fi situaţii [în special în paginile cap capitol] când se citesc mai întâi zone din partea de jos a paginii şi mai apoi zone din partea de sus a aceleiaşi pagini:
Din păcate în Abbyy FineReader 11 nu se mai evidenţiază ordinea ariilor de citire... sau, nu am găsit eu setarea care permite evidenţierea şi renumerotarea lor. Din motivele enunţate mai sus, recunoaşterea este mai sigură în cazul paginilor splituite decât în cazul imaginilor paginilor duble.
În altă ordine de idei, problema erorilor Abbyy este de neglijat în cazul cărţilor noi şi bine scanate, şi foarte importantă în cazul cărţilor vechi. La fel de important este senzorul scanerului: Senzorul CCD nu este influienţat foarte tare de gradul de lipire a paginii cărţii pe ecranul scanerului şi nici de gradul de lumină ambiantă, timp în care senzorul CIS este influienţat de lumina ambiantă şi dă erori dacă pagina cărţii nu este foarte bine lipită de ecranul scanerului.
În funcţie de calitatea scanării, uneori este necesară în mod obligatoriu prelucrarea imaginilor, astfel că un OCR bun se obţine din imagini prelucrate şi nu din imagini brute.
Întrebare suplimentară: Dacă cel mai bun OCR se obţine din imaginea brută, pentru ce mai facem prelucrări în Scantailor şi alte editoare de imagini? De regulă, aceste prelucrări se fac în vederea obţinerii unor fieşiere scan-control, fie ele PDF sau DjVu, care să aibă un raport cât mai bun mărime/calitate.
Nu se pot obţine totdeauna fişiere alb-negru de calitate. Astfel de fişiere se pot obţine doar din scanări de înaltă calitate. Indiferent cum ar fi, nu se recomandă sub nicio formă scanarea directă în alb-negru, ci doar în Grayscale 300 dpi sau Color 300 dpi - la coperte şi în cazul revistelor, cărţilor vechi de colecţie etc.
E posibil ca în unele cazuri să nu se obţină fişiere lizibile în alb-negru, iar dacă scanarea a fost făcută direct în AN, atunci toată munca de scanare a fost în zadar. Din contra, dacă scanarea este în Grayscale, chiar dacă fişierele AN vor fi nefolositoare, cele grayscale vor fi de folos, chiar dacă imaginea nu este de mare calitate.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #115 |
|
|
Mai clar de atat nu se poate. Multumesc. Nu mai am intrebari.
|
|
| |
|
| #116 |
|
|
Un mic amanunt.... Niciodata nu se face zonarea si recunoasterea automata a zonelor de text in Abby! Riscati sa pierdeti pagini intregi sau sa se amestece textul, dupa cum zicea si Seven mai sus.
Intodeauna faceti zonarea manuala a zonelor de text si de imagini. Adica luati fiecare pagina la rand si trasati voi insiva zonele de text si imagine, apoi puteti lasa softul sa faca recunoasterea caracterelor.
Ai dreptate in legatura cu numerotarea zonelor din Abby 11, ea apare doar daca folosesti functia Reorder. Nu am observat amanuntul acesta pentru ca zonarea o fac manual.
|
|
| |
|
| #117 |
|
|
utilitasetveritas a scris:
Un mic amanunt.... Niciodata nu se face zonarea si recunoasterea automata a zonelor de text in Abby! |
- - > EXACT! În exemplul de pagină oferit de Seven ar fi o adevărată aventură să-l laşi pe ABBY să facă ce vrea. Practic fiecare fibră de lemn de pe pagină va fi interpretată ca fiind o literă sau un grup de litere care evident se vor regăsi din belşug în text - ceea ce va îngreuna corectarea OCR-ului.
_______________________________________ ---> "Eu nu am regrete, Iar dac-ai să-ntrebi ce-a rămas la mine, În inimă am urme de tine Regrete, eu nu am regrete..."
|
|
| |
|
| #118 |
|
|
Buna ziua mi-am cumparat si eu un KINDLE debea stiu sa il deschi ..Am o intrebare cum bag carti am incercat cu cablu de date copy paste nu merge explicatimi si mie VA MULTUMESC
|
|
| |
|
| #119 |
|
|
NicoaraBnD a scris:
Buna ziua mi-am cumparat si eu un KINDLE debea stiu sa il deschi ..Am o intrebare cum bag carti am incercat cu cablu de date copy paste nu merge explicatimi si mie VA MULTUMESC |
In mod normal se face Copy/Paste in dosarul Documents de pe Kindle.
|
|
| |
|
| #120 |
|
|
Aş avea şi eu o întrebare: oare care ar fi cel mai potrivit font de încorporat într-o carte pt a fi citită pe Kindle?
_______________________________________ Tutorial docx în epub și mobi
|
|
| |
|
| #121 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #123 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #124 |
|
|
Pe de-o parte aşa este dar pe de altă parte cuvintele scrise cu sedilă nu le recunoaşte dicţionarul in limba română adică o fac de nevoie.
_______________________________________ Tutorial docx în epub și mobi
|
|
| |
|
| #125 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|