Forum Romania Inedit
Romania Inedit - Resursa ta de Fun
|
Nou pe simpatie: mimy_glacier
 | Femeie 24 ani Prahova cauta Barbat 26 - 47 ani |
|
|
Forum Romania IneditReguliInregistrareLoginPozeNu sunteti logat. Lista Forumurilor Pe Tematici
|
| #127 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #128 |
|
|
Ei, ce vrei, sunt doar cateva mii de inregistrari 
|
|
| |
|
| #129 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Am rezolvat. Am verificat toate înregistrările din cele două dicţionare. Am corectat condiţiile acolo unde a fost necesar. Pentru cei care au downloadat deja fişierul [2014.10.05] OCR_DIC Contemporan.rar, uecat acum câteva zile, am urcat o mică arhivă care cuprinde doar cele două dicţionare modificate [CO_Var5.imd şi CO_Var6.imd] Nume arhivă: [2014.10.12] CO Var.5+6.rar Adresa: http://www.mediafire.com/?wdtyl7438c7c50r
Pentru cei care nu au făcut încă download la actualizarea din [2014.10.05], am urcat o arhivă completă care cuprinde toate dicţionarele OCR_DIC la data de 12.10.2014. Nume arhivă: [2014.10.12] OCR_DIC Contemporan.rar Adresa: http://www.mediafire.com/?ypduhwg76wgn775
De reţinut! [1] Prin termenul "Cuvânt întreg" în înţelesul Ac OCR Plus se înţelege un sir de caractere format din diverse caractere, astfel: - putem avea un cuvânt în înţelesul obişnuit, format din una sau mai multe litere, precum "i, de, fiu, dacă, adică, dintre, fiindcă, adevărat, mulţumesc, întotdeauna..." - putem avea un grup de cuvinte cu spaţiile şi semnele de punctuaţie dintre ele: "Nu există putere care să nu"... "Aflaţi că avem părinţi. Nu prea ştiţi voi bine ce"...
Şirul de caractere poate începe cu orice caracter, cu excepţia semnelor de punctuaţie. Şirul de caractere se poate termina cu orice caracter, inclusiv semne de punctuaţie.
Un şir "cuvânt întreg" nu poate începe cu un semn de punctuaţie. Dacă avem un şir care începe cu un semn de punctuaţie, nu se poate pune condiţia "cuvânt întreg", ci doar "păstrează capitalizarea" sau "Potrivire perfectă". O înregistrare de genul "? 1111 fi îngrijorat >> ? Nu fi îngrijorat" setată cu condiţia "Cuvânt întreg" nu funcţionează... nu rulează...
De reţinut! [2] Condiţiile "Păstrează capitalizarea" şi "Potrivire perfectă" nu se pot pune împreună, deoarece ele sunt relativ opuse. Practic, condiţia "Potrivire perfectă" anulează condiţia "Păstrează capitalizarea". În concluzie, putem pune doar una dintre condiţii: ori "Păstrează capitalizarea", ori "Potrivire perfectă".
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #130 |
|
|
Primul tau pont chiar nu il stiam. Oricum atunci cand ma hotarasc sa adaug o inregistrare in dictionarul meu, mai intai il testez pe 3-4 randuri de text ca sa ma asigur ca se ocupa cum trebuie de portiunea de text ce ma intereseaza. M-ai scutit de ceva nervi prin urmare 
Multumesc pentru treaba excelenta pe care o faci.
|
|
| |
|
| #131 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Eroare nouă.
De fapt, doar descoperirea este nouă... probabil eroarea a existat, numai că nu a fost semnalată pe forum. Este vorba de confuzia Abbyy " ri = n". Până acum ştiam de confuzia " m = rn ", unde, de regulă, litera "m" era redată eronat prin grupul "r n". Mult mai rar eroarea apare şi invers, când grupul "r n" este redat eronat sub forma literei "m". De eroarea asta ne-am ocupat şi vor mai fi şi alte înregistrări.
Să revenim la " ri = n ". Scanez nişte cărţi în care punctul de pe "i" este poziţionat mai sus decât în mod normal şi Abbyy nu vrea să "citească" şi punctul, astfel că-l "vede" pe acel "i" fără punct şi-l redă ca fiind "l" [L mic], ori îl lipeşte de o literă vecină. În situaţia în care acest "i" apare după un "r", Abbyy s-a gândit el că e vorba de litera "n". N-am constatat ca eroarea să apară şi invers, dar n-o exclud.
Acest "n" eronat mi-a apărut de cele mai multe ori la sfârşit de cuvânt. Am plecat de la această constatare şi am făcut căutarea grupului "r i" la sfârşitul cuvintelor. Sunt frecvente două terminaţii care conţin grupul "ri": "rilor" = 24.503 cuvinte "rile" = 18.231 cuvinte Ar mai fi terminaţia la gerunziu "rind" = 464 cuvinte plus secvenţa "rindu- " = 887. Alte terminaţii clare n-am mai găsit încă.
Deocamdată am rezolvat problema pentru [toate] cuvintele care au terminaţia "rilor". Am înregistrând secvenţe de final formate din 7 litere: 2 litere + terminaţia "rilor". Ex.: anlor >> arilor; banlor >> barilor ........ yunle >> yurile; zunle >> zurile. Total înregistrări = 276.
Plecând de la aceste terminaţii am realizat şi nişte înregistrări pentru corectarea ruperii acestor cuvinte; de data asta a folosit secvenţe formate din 8 litere: 3 litere plus terminaţia "rilor", ca în exemplul: b- aurilor >> baurilor bau- rilor >> baurilor bauri- lor >> baurilor Fiind vorba de 3 litere din faţa terminaţie şi de 3 înregistrări pentru fiecare astfel de secvenţă, numărul înregistrărilor rezultate este destul de mare: 4410 înregistrări.
Dacă sunt useri dispuşi să testeze aceste dicţionare sau să se documenteze mai mult asupra lor, pot uploada dicţionarele şi materialele statistice folosite.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #132 |
|
|
Pe moment (sunt la pagina 300 din 600 in Abby) nu am ce testa. Cand o sa finalizez si ocr-ul asta blestemat o sa fac verificarea pagina cu pagina a ceea ce a facut AC-ul.
Nu te stresa chiar atat de tare cu erorile de citire din Abby. Tind sa varieze in functie de carte. Poti face dictionare separate cu noile descoperiri, lasa optiunea de marcare a textului si adu-le pe forum.
|
|
| |
|
| #133 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Ai dreptate @utilitasetveritas. Nu ne putem ţine cu dicţionarele după toate erorile Abbyy, deoarece fiecare tip de font, fiecare editură... oferă alte şi alte tipuri de erori.
M-am gândit să trec la o nouă fază în AutoCorect - reducerea timpului de rulare.
Am început să testez fişiere mari OCR-brut şi să urmăresc timpii de rulare ai fiecărei opţiuni, apoi să reverific numai opţiunea respectivă pe bucăţi şi bucăţele. Am constatat că o singură înregistrare eronată poate duce la modificări în buclă, care lungesc durata de rulare, chiar dacă la sfârşit se obţine un rezultat bun. Am scurtat deja timpii la câteva opţiuni, dar cred că se mai pot face încă multe lucruri pentru eficientizare. De exemplu: la L3 am un pachet de 96 de înregistrări, de genul: " 1 s-a spus, 1 se explica... >> I s-a spus, I se explica... "
Pentru ca cifra 1 să fie litera I mare, este vorba de început de frază, astfel că a trebuit să repet înregistrările în mai multe condiţii, astfel că avem: " . 1 s-a spus >> . I s-a spus " - început de frază după punct. " 1 s-a spus >> I s-a spus " - la început de paragraf obişnuit; " — 1 s-a spus >> — I s-a spus " - început de paragraf cu linie de dialog; " —^s1 s-a spus >> —^sI s-a spus " - început de paragraf cu linie de dialog urmată de spaţiu neseparator.
Adăugând o înregistrare de genul " — s1 >> —^s1 " deci punând spaţiu neseparator după toate liniile de dialog după care urmează cifra 1, am putut elimina pachetul de 96 de înregistrări care se referea la linia de dialog cu cifra 1 urmată de spaţiu obişnuit. Ăsta este un exemplu.
Alt exemplu: am constatat că la opţiunea 2.2 Punctuatie / Corectare linii de pauză şi dialog timpul de rulare era cam mare faţă de numărul de înregistrări. N-am găsit explicaţia, aşa că am început să rulez fiecare dintre cele două dicţionare separat. Dicţionarul Co_LinD.imd rula mai greu şi se împotmolea undeva la 80%, deci înregistrările care produceau probleme se aflau undeva în zona înregistrării 128 din totalul de 160 de înregistrări. Am dezactivat toate înregistrările de la nr.120 până la 160, am făcut o rulare, apoi am acrivat încă 2 înregistrări şi tot aşa. Am dat peste o înregistrare pe care eu o credeam " Horizontal Bar >> EmDash", în care la căutare era forma grafică şi nu codul pentru Horizontal Bar, doar că în realitate era era o înregistrare " EmDash >> EmDash ", care deşi nu producea o eroare, era o rulare în plus şi de lungă durată. Am corectat cu Horizontal Bar şi dicţionarul rulează mult mai repede pentru că el caută numai Horizontal Bar în loc de dialog şi nu mai înlocuieşte EmDash cu el însuşi.
Sunt şi probleme care par mai uşor de rezolvat în Word. De exemplu, opţiunea 1.3 Conversii preliminare / Eliminare tab şi spaţii multiple rulează destul de greu în AC. În principiu, dacă am face mai înainte două înlocuiri: "tab >> spaţiu" şi "două spaţii >> un spaţiu",atunci opţiunea ar rula mult mai repede. Am testa cele două înlocuiri în Word: ele se fac foarte-foarte repede, mult mai repede decât în AC. Cred că un mic template prin care să rulăm textul înainte de a-l încărca în AC, ar fi de mare folos.
Una peste alta, ideea este că după ce voi mai face câteva modificări de dicţionare, voi urca o nouă versiune, care ar trebui să ruleze ceva mai repede. Dekci,urmează dicţionare noi.... 
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #134 |
|
|
era mal > era mai fi mal > fii mai fii mal > fii mai cel mal > cel mai cea mal > cea mai
mal puțin > mai puțin mal tare > mai tare mal încet > mai încet mal repede > mai repede mal lent > mai lent
Pc Cli (sa nu uiti sa debifezi Cuvant Intreg))
Nu par a fi in OCR+. A doua serie de inlocuiri e discutabila, cred ca lista de expresii care incep cu "mai" poate fi cam lunga. Prima serie consider ca e folosita mai des. Pe de alta parte, cred ca nici cuvantul "mal" nu apare atat de des intr-un text incat sa enerveze utilizatorul cu alerte inutile. Cred ca e mai bine doar o inlocuire de genul:
mal > mai Ci Pc CLi
P.S. Timpii de rulare cresc simtitor atunci cand e folosit un fisier txt.
|
|
| |
|
| #135 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** 1. N-am încercat rularea în AC+ a fişierelor "txt". Am încercat fişiere "txt" doar pentru căutări de cuvinte în AC+ şi uneori viteza de căutare în "txt" a devenit mult mai mare decât "rtf", deoarece fişierul s-a mărit la convertirea rtf > txt. Voi încerca să fac nişte teste în sensul ăsta. Din păcate o serie de cărţi nu pot fi reduse la formatare "txt".
2. "mal > mai" şi alte asemenea. Eu am lucrat ceva în sensul ăsta, folosind înlocuiri grup cuvinte. Am folosit condiţia înlocuire automată, dar şi înlocuiri cu confirmare. Dacă înlocuiri de genul "cea/cel/cele/cei mal bun[e/i] >> cea/cel/cele/cei mai bun[e/i] se pot face automat, atunci sunt înlocuiri ca cele menţionate de tine unde confirmarea este obligatorie.
Ideea este că astfel de dicţionare sunt foarte preţioase uneori şi total lipsite de importanţă de cele mai multe ori... depinde de carte.... Din cauza asta ele nu pot fi incluse în OCR_DIC sau UZUALE pentru că ar prelungi rularea fără rost atunci când nu sunt necesare, deci în majoritatea situaţiilor. Pe de altă parte, în cazurile în care eroarea "mal > mai" este frecventă, o singură înregistrare cu confirmare ne-ar consuma foarte mult timp.
Cred că am avea nevoie de o a treia categorie de dicţionare la acre să apelăm numai în situaţii speciale... să le zicem acum Dicţionare ZZZ. Astfel de dicţionare le putem păstra în computer fără să facem rularea automată a lor, ci să apelăm la ele doar atunci când constatăm că este nevoie de vreunul dintre ele. Adică... dacă rulând OCR_DIC unde avem înlocuirea cu confirmare "mal >> mai" constatăm că sunt multe înlocuiri, atunci renunţăm la această înlocuire, urmând ca după terminarea rulării programului să rulăm manual dicţionarul "Z_mal_mai.imd".
Sunt şi alte cuvinte care care pot fi corectate cu astfel de dicţionare. De exemplu cuvântul ele "ele", care la unele cărţi poate fi redat eronat chiar cu cuvântul "de". Atât "ele" cât şi "de" sunt cuvinte de mare frecvenţă, aşa că atunci când apar astfel de erori, dacă mergem pe confirmare situaţie cu situaţie, vom consuma extrem de mult timp.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #136 |
|
|
A... da, scuze, nu am fost clar.
Genul asta de inlocuiri le fac separat de OCR+. Am un dictionar ZZZ, dupa cum zici tu, si uneori e folositor, alteori nu face absolut nimic. Adaug in el acele probleme, gasite la verificarea 1.0 a textului, ce se repeta si care nu fost aranjate de OCR+. Oricum nu cred ca sunt mai mult de 30 de erori pana acum.
|
|
| |
|
| #137 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Constat că apar mereu probleme legate de instalarea sau funcţionarea AutoCorect OCR Plus. Mi se semnalează că programul nu rulează corect... că apar mesaje de genul "Dicţionarul _____ nu poate fi deschis."
Programul nu are nicio hibă. problema este că utilizatorul a greşit ceva pe undeva. Am să reiau discuţia şi să explic câteva probleme de bază despre AutoCorect, apoi voi încerca să redau câteva cauze posibile al unor astfel de mesaje.
Să revenim la mesajul "Dicţionarul _____ nu poate fi deschis."
1. Ce tip de dicţionar nu poate fi deschis? Este vorba despre unul dintre dicţionarele din OCR_DIC sau un dicţionar Uzual? Cum stabilim acest lucru? Ne uităm la numele dicţionarului cu probleme şi vedem din ce pachet face parte.
Varianta cea mai simplă: 1.1. Este vorba despre un dicţionar Uzual.
Cauza: faţă de setările anterioare folosite de noi a apărut un dicţionar sau mai multe cu numele schimbat. Rezolvare: apăsăm opţiunea de rulare automată a opţiunilor OCR Plus. Apare fereastra cu opţiunile afişate unele sub altele. În dreptul unora dintre dintre ele apare în dreapta menţiunea "Opţiuni", ca în imaginea următoare:
În dreptul opţiunii 9. Rulare grup de dicţionare... apare această menţiune, marcată cu roşu în imagine. Apăsăm butonul "Opţiuni" din dreapta opţiunii 9 şi se va deschide mica fereastră "Rulare dictionare". Cel mai simplu este să ştergem unul câte unul toate dicţionarele şi apoi încărcăm din nou dicţionarele pe care le avem acum la dispoziţie, fie ele dicţionarele Uzuale, dar şi unele personale [dacă avem aşa ceva] Aici se pot încărca dicţionare din mai multe foldere. AutoCorect va salva calea lor de căutare într-un fişier text, aşa că le va găsi oriunde le-aţi pune. Atenţie! nu se încarcă aici şi dicţionarele OCR_DIC,deoarece ele ar rula de două ori: o dată rulate de opţiunile OCR PLus şi apoi se face rularea în grup... ceea ce înseamnă pierdere nejustificată de timp.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #138 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Varianta mai complicată: 1.2. Este vorba despre un dicţionar OCR_DIC.
Pentru situaţia asta există mai multe cauze. Dacă utilizatorul a folosit AutoCorect OCR Plus şi lucrurile au mers bine şi a apărut acum un astfel de mesaj înseamnă că a apărut o eroare: a fost şters sau redenumit din întâmplare un dicţionar. Utilizatorul cu experienţă va găsi problema şi o va rezolva.
Dacă utilizatorul nu a mai folosit AutoCorect OCR Plus, deci este la prima instalare, înseamnă că nu a copiat dicţionarele OCR_DIC unde trebuia.
Menţionez un aspect: kiturile de instalare AutoCorect Standard [variantele Contemporan sau Clasic], executabilele AutoCorect OCR Plus şi ultimele dicţionare sunt cele postate pe topicul AutoCorect OCR Plus 5.1 – Ultima Actualizare
Kiturile AC Standard şi executabilele sunt postate acolo chiar de către Cosmin Ciupercă şi sunt cele mai bune. Nu e cazul să căutaţi cu Google kituri pentru Ac Standard. Luaţi-le cu încredere pe cele postate chiar de autor. Nu există în altă parte ceva mai bun.
În concluzie, dacă AC OCR Plus nu funcţionează, nu kiturile sunt de vină, ci în mod sigur modul de instalare şi locul unde au fost copiate dicţionarele.
Să stabilim un lucru clar: AutoCorect OCR Plus are două foldere numite Dictionare în două locuri complet diferite. Dacă nu copiem dicţionarele în folderul care trebuie, AC OCR Plus nu va funcţiona. Aş face o glumă: a confunda cele două foldere Dictionare e ca şi când am confunda Noua Zeelandă cu Islanda... pentru singurul motiv că în ambele ţări există vulcani activi.
Să revenim la cele două foldere numite Dictionare. Primul se află în Program Files în folderul de instalare al AutoCorect. El se instalează automat la instalarea AutoCorect standard, aşa ca în imaginea următoare: Pentru amicşora imaginea, am păstrat din imagine doar calea de căutare şi conţinutul folderului şi am marcat pe imagine calea de căutare şi folderul cu pricina.
Iată ce anume conţine acest folder Dicţionare. Am marcat şi aici calea de căutare.
Buun! Deci,aici avem dicţionarul DEX, alte dicţionare ale limbii române, dicţionare pe baza cărora funcţionează corectorul de limbă al AutoCorect. Acest folder nu are nicio legătură cu dicţionarele care rulează la opţiunile OCR Plus. Ăsta ar fi subfolderul Dicţionare din Noua Zeelandă.
Acum să căutăm celălalt folder Dicţionare, adică pe cel din Islanda.
Iote-l frate! Uitaţi-vă la calea de căutare! Nimic comun cu celălalt folder Dicţionare... doar Diskul este acelaşi. Atenţie! În calea de căutare apare un "K7" - aşa-l cheamă pe computerul meu. Pentru cine nu ştie, la instalarea Windows fiecare stabileşte un nume pentru computerului lui. Pe al meu aşa-l cheamă... K7.
Să ne uităm acum în imaginea următoare şi la ceea ce conţine acest folder Dicţionare din AppData [ca să nu mai zic din Islanda].
În acest folder Dicţionare găsim: – folderul OCR_DIC este folderul care ne interesează şi în care se găsesc ele 39 de dicţionare din pachetul OCR_DIC. Demenţionat că acest folder trebuie să se numească chiar aşa. Dacă-l redenumim, AC OCR Plus nu mai funcţionează deoarece executabilul are stabili numele exact al folderului în care să caute şi calea de căutare.
– folderul Dic UZUALE Contemporane este folderul care conţine dicţionarele uzuale. El poate avea orice nume doreşte utilizatorul, deoarece executabilul nu are stabilită deja o cale de căutare pentru aceste dicţionare. Asta o stabilim noi aşa cum am spus mai sus.
Tot aici mai găsim şi câteva fişiere, astfel: – dicţionarul "implicit.imd" pe baza căruia putem crea noi dicţionare de înlocuire multiplă: el este instalat direct la prima rulare a executabilului AC OCR Plus. – dicţionarele a.dic, i.dic, np.dic, p.dic sunt dicţionare suplimentare care se folosesc la rularea ortografiei în AC, astfel: "a.dic" conţine înregistrări de abrevieri ale programului, "i.dic" conţine cuvintele ignorate de dumneavoastră când aţi rulat ortografia, "p.dic" conţine cuvintele adăugate de dumneavoastră când aţi rulat ortografia, iar "np.dic" conţine nume de persoane şi este un dicţionar instalat deja de AC.
Iată în imaginea de mai jos dicţionarele din folderul OCR_DIC:
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #139 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Să revenim: Dacă primim un mesaj în care se arată că nu se poate deschide un dicţionar. Vedem din ce pachet face parte dicţionarul. Dacă este un dicţionar Uzual am explicat mai sus cum procedăm.
Dacă este vorba de un dicţionar din pachetul OCR_DIC privim cu atenţie, pentru că sunt două posibilităţi: – dicţionarul pare să fie unul de tip OCR_DIC, dar nu este nicunul din cele 39 din imaginea din poatarea anterioară. De exemplu, mesajul este "Dicţionarul CO.SMed.imd nu poate fi deschis." În acest caz este vorba de un dicţionar care într-adevăr a avut acest nume, dar asta se întâmpla cu mult timp în urmă. La momentul acela aveam un singur dicţionare de secvenţe mediane. Între timp au fost stabilite două şi le cheamă CO.SMed1.imd şi CO.SMed2.imd... deci CO.SMed.imd nu mai există în ultima versiune AC OCR Plus. Înseamnă că executabilul AC OCR Plus pe care-l folosiţi este un executabil vechi, deci nu aveţi ultima versiune a executabilului. De-a lungul timpului au existat peste 100 de versiuni de executabile... deci faceţi download şi copiaţi în folderul de instalare ultima variantă a executabilului şi apoi verificaţi funcţionarea AC.
– dicţionarul este într-adevăr unul dintre cele 39 arătate mai sus, el există... şi cu toate astea AutoCorect face pe nebunul şi zice că nu-l găseşte. Ei bine, AutoCorect nu este nebun şi nici nu-i arde de glume. Înseamnă că dumneavoastră aţi copiat dicţionarele OCR_DIC în alt loc şi nu acolo unde trebuie. Cred că e ceva confuzie între folderul din Noua Zeelandă şi cel din Islanda... Verificați bine calea de căutare pe care am arătat/o mai sus și puneți dicționarele exact acolo unde trebuie.
Sper din tot sufletul ca acum să fi clarificat mai bine problema asta. Şi scuze de comparaţia cu Noua Zeelandă şi Islanda, dar... n-am găsit alta. 
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #140 |
|
|
Tot nu am reusit sa imi dau seama care sunt ultimele variante de dictionare. Un pic de ajutor?
|
|
| |
|
| #141 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #142 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #143 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #144 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Referitor la ultima versiune de dicţionare: Este important de reţinut că în ultima opţiune "10.3 Înlocuiri cu confirmare" rulează 3 dicţionare [CO_Var5.imd, CO_Var6.imd şi CO_Var7.imd] cu un total de circa 1500 de înregistrări cu confirmare. Sunt într-adevăr multe, dar dacă ne plictisim şi renunţăm să le rulăm, înseamnă că nu beneficiem de vreun sfert din posibilităţile AC.
În altă ordine de idei, menţionez că am încercat să elimin cât mai multe dintre înregistrările care produc efecte secundare nedorite: pe unele le-am transferat la modificări cu confirmare. Pe de altă parte am adăugat multe înlocuiri în dicţionarele Uzuale: deşi este vorba de cuvinte lungi, unde posibilitatea efectelor secundare este redusă, este posibil, totuşi, ca la vreunele să nu fi observat la timp existenţa efectului secundar.
Dat fiind că am hotărât să renunţ şi eu la acest proiect şi nu mai intenţionez să dezvolt dicţionarele, ar fi bine ca în perioada următoare, adică timp de o lună, maxim două luni, să mi se semnaleze eventualele înregistrări care produc efecte secundare nedorite pentru a le corecta.
Referitor la utilitatea AutoCorect OCR Plus. Nu intenţionez să laud sau să critic AutoCorect OCR Plus şi nici să recomand folosirea lui ori să propun evitarea lui. Singurul lucru pe care-l pot menţiona este că eu îl folosesc la pregătirea textelor din vara anului 2009 când exista versiunea AutoCorect 2.3 şi voi continua să-l folosesc atâta timp cât voi mai corecta cărţi în interes public sau personal. Eu sunt unul dintre miile de useri de pe forum, aşa că din punct de vedere matematic părerea mea are o valoare care tinde către zero.
AutoCorect OCR Plus există. Fiecare user este în măsură să hotărască dacă-l foloseşte sau nu. Singura recomandare: când foloseşti o unealtă, un instrument, este bine să te documentezi cum funcţionează; e valabil şi la AutoCorect.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #145 |
|
|
Toate erorile semnalate de mine au fost verificate prin metoda pe care ai propus-o in penultima postare. Banuiesc ca nu e o noutate, doar ai uitat sa o mentionezi pana acum.
Daca renunti la dezvoltarea dictionarelor, nu e nicio problema. Chiar ma intrebam cat mai rezisti de unul singur. Dar, in masura in care iti sunt semnalate erori, daca poti, sa asiguri un minim de asistenta. Banuiesc ca o sa fie nevoie sa faci un mic tutorial cu felul in care gasesti o inregistrare eronata in toate acele dictionare. Pe de alta parte, pana acum, numarul de erori a fost destul de mic, asa ca nu cred ca o sa fii sufocat, pe viitor, de erori si cereri de remediere a lor.
Cred am ajuns si in situatia de a avea un subiect FINAL cu AC si OCR+. Peste 2-3 luni bineinteles.
Multumesc pentru toata munca depusa. Mi-ar fi placut sa fie mai multa agitatie prin aceste pagini. Dar, daca doresti, poti considera ca ti-ai facut treaba suficient de bine incat clientul sa nu aiba plangeri de nicio natura.
|
|
| |
|
| #146 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Practic pe mine nu mă deranjează să dezvolt în continuare dicţionarele. Oricum o fac pentru mine personal şi la fiecare carte adaug cuvinte noi într-un dicţionar TEMP pe care apoi le selectez şi pe unele le mut la locul lor, pe altele le şterg. Chestia este că am sentimentul că vorbesc singur, că par cineva care vrea doar să se bage în seamă clămpănind aiureli despre lucruri neinteresante. Sentimentul meu este că deranjez şi par cel puţin nebun tot vorbind despre AC unor oameni pe care nu-i interesează absolut deloc problema asta. Pur şi simplu, încerc să nu mai postez despre AC pentru a nu mai atât de penibil.
Postarea de mai sus am făcut-o doar în ideea ca userul să verifice dacă AC-ul este cel care produce anumite greşeli, ori dacă greşelile respective ţin de Abbyy... sau de altă manevră făcută cu neatenţie. Eu ştiu că AC poate face unele modificări nedorite, mai ales la cuvintele străne - pentru simplu fapt că este gândit pentru secvenţe de litere din limba română, dar în acelaşi timp ştiu că i s-au pus în cârcă lucruri pe care nu le-a făcut niciodată.
Am să încerc să fac nişte tutoriale. Cred că am să le explic mai întâi pe forum, apoi am să le culeg într-un fişier DOC sau PDF. Poate că ar trebui să explic mai întâi care sunt dicţionarele pe care le rulează fiecare opţiune pentru a putea şti cum să fie depistate dicţionarele suspecte; Mă mai gândesc... încerc să găsesc soluţia cea mai comodă pentru mine, dar şi pentru eventualii useri interesaţi.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #147 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
tuf a scris:
Seven, eu nu mai tin minte, noile dictionare OCR se ocupa si de problema ghilimelelor? Ma refer la acel dictionar separat. De cand am pus noile dictionare OCR, problemele ghilimelelor au disparut, cu exceptia unei situatii legata de ghilimele si puncte de suspensie la inceput de cuvant.
Cu dictionarul celalalt ai avut timp sa faci vreo ceva? |
Mai întâi de toate, am să te rog să postezi aici problemele legate de dicţionare. Topicul ăsta este mai vizibil decât cel pus sus şi văd mai repede că s-a postat ceva nou.
1.a. Ghilimele rezolvate Da, am încercat să rezolv problema ghilimelelor; cred că cele de sfârşit [de închidere] este rezolvată complet. Am încercat ca toate ghilimele de sfârşit să fie de forma 99 sus; e posibil să fi rămas ceva situaţii cu cele de forma 66 sus; oricum, toate ghilimele drepte, fie ele verticale sau oblice, ar trebui să fie rezolvată.
1.b. Ghilimele nerezolvate: Rămân încă probleme în interiorul paragrafului cu acele ghilimele false, apărute ca urmare a unor pete pe hârtia tipărită. De asemenea am descoperit nişte probleme la ghilimele de început, în situaţiile în care nu sunt lipite de litera care urmează. N-am găsit încă un mod de rezolvare.
2. Dicţionarul tău - punctuaţie. Majoritatea situaţiilor sunt rezolvate cu câteva excepţii: conversia ?! >> !?; eu cred că există ambele variante şi nu aş înregistra această modificare; există 3-4 înregistrări pe care nu le înţeleg, deoarece par că se modifică prin ele însele;
2. Dicţionarul tău - cuvinte. O parte există deja înregistrate, altă parte dintre înregistrări nu sunt în dicţionarele OCR. Deocamdată, pe baza dicţionarului tău am salvat un nou dicţionar din care am eliminat ceea ce este deja înregistrat şi acum încerc să vedem ce şi unde mai pot înregistra. Cele mai importante înregistrări mi se par cele din familia "tăcu >> făcu", doar că încerc să le găsesc o formulă în grup de litere ca să nu caute toate cuvintele cu rădăcina "tăcu"
Ideea este că am să-ţi restiui un dicţionar mai mic, care va conţine doar înregistrări care nu se regăsesc în OCR_DIC sau Dic_Uzuale.
ATENŢIE! Toate dicţionarele OCR_DIC şi Uzuale au diacritice cu sedila. Am văzut că la tine apar şi diacritice cu virgulă. E o problemă la care trebuie să cugetăm foarte bine. Pentru cei care folosesc diacritice cu virgulă există două variante de lucru: - ori rulează OCR_DIC în varianta diacritice cu sedila şi la final fac tot în AC conversia "diacritice cu sedila >> diacritice cu virgula" - ori va trebui ca toate dicţionarele să fie realizate şi în varianta diacritice cu virgulă, dar e mult de muncă [eu nu mă bag la editarea lor] şi, în plus,unii dintre useri vor încurca dicţionarele.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #148 |
|
|
Bun, astept varianta prescurtata a dictionarului meu.
Chestia cu sedila... hmmm.... nu stiam de chestia asta  Conversia in virgula o faceam la final in ocr. Dar au fost si texte cu forma actuala de scriere, sa inteleg ca acestea nu au beneficiat de OCR+ din cauza sedilei din dictionare?
In esenta nu ar fi o problema, nu a modificat nimic, si atat. Efect nul. Dar e bine de stiut.
P.S. Am deschis dictionarul meu PostOCR+ in AutoCorect, cu Open With. Am inlocuit virgulele cu sedila, am salvat. Dictionarul pare OK. Ai incercat asa?
P.S. De fapt nu merge. Dictionarul nu pare sa functioneze.
P.P.S. Uite 2 dictionare functionale: http://www71.zippyshare.com/v/L2TF6vpW/file.html
P.P.P.S. Cred ca te-am inteles gresit. De fapt dictionarele functioneaza, indiferent de tipul de diacritice folosit in text, dar inlocuirile se fac numai cu sedila, deoarece asta exista in dictionare.
Bun. Notepad+ http://www45.zippyshare.com/v/6ZvHer71/file.html
permite deschiderea tuturor dictionarelor in acelasi timp si poate face aceeasi inlocuire in toate dictionarele in acelasi timp. Nu pare sa strice nici dictionarele asa cum face Notepad-ul din Windows. Deci e floare la ureche de inlocuit sedila cu virgula. Asta ti-o zic din fuga calului... Daca solutia mea nu functioneaza, tot nu e bai. Cat de greu sa fie sa in locuiesti in Word Ș si Ț cu sedila cu Ș si Ț cu virgula?
|
|
| |
|
| #149 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #150 |
|
|
Deci 99 inseamna orice cifra? Zau? Eu tocmai terminasem seria cu 4 )
OK, deci descarc iarasi OCR+... de unde?
|
|
| |
|