Filehost.ro - gazduire fisiere
Forum Romania Inedit
Romania Inedit - Resursa ta de Fun
Nou pe simpatie:
bella_sexy din Bucuresti
Femeie
25 ani
Bucuresti
cauta Barbat
27 - 48 ani
Forum Romania IneditReguliInregistrareLoginPozeNu sunteti logat. Lista Forumurilor Pe Tematici
Forum Romania Inedit / Totul despre cărți - About e-books /

AutoCorect - reactualizare

Pagini: 1 ... 9 10 11 12 13 14 15 Moderat de Seven, Stelevadris, cuculean, naid, uncris
#276
Seven
Moderator
Din: Ţara Perfectului Simplu
***
       Salutare!

       După câte ştiţi forumul ăsta este cam bolnav, astfel că o serii de funcţii funcţionează aiurea sau nu funcţionează deloc. Adeseori sunt erori nu numai la postări, ci şi la mesajele private... iată de ce am să dau un răspuns aici pe topic la o întrebare primită pe MP. Întrebarea era: "...ce aduce nou ultima actualizare?"

       Înainte de a da un răspuns, aş menţiona câteva lucruri.
       – Chiar dacă în ultima jumătate de an nu am fost foarte activ pe forum, în fapt am continuat să prelucrez cărţi, inclusiv să prelucrez OCR-uri cu AutoCorect.
       – Perierea OCR-urilor în AC o fac la maximum posibil, astfel că nu numai că folosesc complet toate dicţionarele pe care le pun la dicpoziţia colegilor, ci folosesc şi alte dicţionare temporare pe care le rulez manual. Permanent am câteva dicţionare temporare în care adaug noi înregistrări, apoi periodic le sortez şi le pun în dicţionarele de bază.
       – Pe timpul prelucrării constat că unele înlocuiri [mă refer în special la cele cu confirmare] apar de două ori... ori sunt înregistrări la care folosesc mai mult butonul "Nu" pentru a refuza confirmarea înlocuirii şi mai puţin butonul "Da" de acceptare... ori, o înregistrare agasantă dar necesară apare prea devreme şi ar trebui să o mut mai spre finalul dicţionarelor cu confirmare. Iată de ce unele înregistrări cu confirmare le şterg sau le mut pentru ca acţiuneaa de confirmare să curgă mai uşor.
       – Unele secvenţe de cuvinte produc erori nedorite, deşi secvenţele sunt corecte. Mă refer la secvenţele de 3 litere... O secvenţă de 3 litere corectă poate da erori atunci când dintre cele 3 litere avem nu doar o eroare, ci două. Iată de ce o parte dintre aceste secvenţe de 3 litere le-am modificat în secvenţe de 4 sau 5 litere. Modificarea are avantaje şi dezavantaje: cu cât secvenţa are mai multe litere, erorile posibile se micşoarează sau dispar complet - ceea ce este un avantaj; pe de altă parte, numărul de înregistrări creşte şi timpul de rulare se măreşte - ceea ce este un dezavantaj.

       Aşa cum am mai spus, eu acord mare atenţie celor 8 dicţionare cu confirmare şi mă refer la dicţionarele Var1-Var7 şi Vt1-Vt4.
       Ştiu că s-a spus de multe ori că se pierde timp cu confirmarea şi că aceste dicţionare sunt o prostie, dar pe mine personal deja de oarece timp nu mă mai deranjează şi nici nu mă mai interesează aceste păreri: eu folosesc din plin aceste dicţionare, le-am văzut importanţa, le îmbunătăţesc permanent şi pentru că oricum le îmbunătăţesc găsesc că este bine să le ofer şi celor care sunt interesaţi.
       Deci, oricum eu îmbunătăţesc dicţionarele pentru mine; nu mă costă nimic să le pun pe forum. Dacă există un singur utilizator care poate beneficia de ele, asta este deja un bine făcut. Cei neinteresaţi de dicţionare sau care nu văd ceva benefic în AutoCorect - efectiv nu mă interesează.


       Să revenim la ultima variantă de dicţionare, cea din 25.09.2016
       – am eliminat câteva înregistrări duble precum cele care se refereau la grupurile de litere < il, ll, II > etc; am eliminat sau schimbat ordinea unor înregistrări care corectau ghilimele... am eliminat corecţie majusculă > minusculă după cuvântul etc., deoarece erau multe înregistrări şi puţine situaţii de corectat...
       – am modificat o serie de secvenţe de 3 litere în secvenţe de 4-5 litere pentru mărirea procentului de corectitudine a modificărilor.
       – am adăugat o serie de cuvinte unde succesiunea o literă fusiformă urmată de apostrof se corectează într-o literă; de exemplu, < i' > poate fi în mod corect litera < r > sau < f >;
              exemple de înlocuiri: cai'e > care, oai'e > oare... i'iecare > fiecare, i'oarte > foarte...
       – similar în cazul literei < T > care uneori este redată eronat ca succesiunea de 3 semne "apostrof_ I mare_ apostrof" < 'I' >. Situaţiile apar doar în cazul literei T mare la început de frază. Aceste înregistrări le-am pus în dicţionarul uzual Uz_T.imd.
       – am adăugat o serie de corecţii la sfârşit de cuvânt... unele la finalul substantivelor: ex: iui > lui, altele la sfârşitul verbelor, în special la verbe la gerunziu: ex: md > ind sau md > ând: alergmd, cobormd, ducmd; bineînţeles, pentru ca secvenţele să nu producă efecte secundare nedorite, am folosit secvenţe de de 5 litere şi în situaţii mai rare, secvenţe de 4 litere.
       – SCUZE! am uitat: permanent adaug înregistrări la dicţionarele care unesc cuvinte rupte [despărţite] la cap de rând, bineînţeles că adaug în mod special cuvinte care au o frecvenţă rezonabilă; am adăugat şi lipire cu confirmare, în special la cuvintele la care prima parte a cuvântului se termină în < î >, iar prin lipite râmâne < î > sau se transformă în < â >... şi altele...

       Deoarece modificările au fost făcute într-o perioadă de câteva luni, nu-mi amintesc exact ce alte modificări am mai făcut. Probabil că unele înregistrări sunt mai vechi decât versiunea din aprilie, deoarece înregistrări le foloseam şi atunci, dar erau în dicţionare temporare.
       Ideea este că ceea ce consider că este bine şi comod de folosit de către mine, cred că poate folosi şi altor utilizatori.

       Tuturor, multă sănătate şi toate cele bune!
       Celor care folosesc AC: ...şi multă baftă şi spor la lucru!   


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#277
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Şi... pentru că a trecut mult timp de când am scris despre rularea pachetului OCR... şi pentru că între timp am făcut ceva modificări în metoda mea de rulare... pentru cei interesaţi, am să încerc să spun câteva cuvinte despre modul în care fac eu acum perierea în AutoCorect.

      Îmi cer scuze pentru faptul că va dura ceva mai mult până am să definitivez această postare.
      Ca să fie clar pentru toată lumea când închei postarea, am să pun la final meţiunea <sfârşit postare>.


      1. Dicţionare Uzuale
      Mai întâi, am să fac o corectură: undeva prin tutorialele de pe forum arătam că sunt importante dicţionarele OCR_DIC şi mai puţin importante dicţionarele Uzuale şi că Uzualele pot fi folosite doar  de către cei care au defilat prin ele.
      Acum afirm clar că ambele pachete sunt la fel de importante şi trebuie rulate obligatoriu de cei ce folosesc AC.
      Practic, diferenţa dintre cele două pachete este faptul că în Uzuale apar cuvinte ceva mai lungi decât în dicţionarele OCR_DIC. La acest moment nicio înlocuire din Uzuale nu se face cu confirmare, deci şi aceste dicţionare rulează complet automat. mai mult decât atât, am periat în mod special dicţionarele Uzuale şi am încercat să elimin orice înregistrare care producea erori.
      Astăzi, din punctul meu de vede, ambele pachete sunt sunt la fel de sigure sau nesigure. Diferenţa este că sunt altfel structurate.
      Am vrut să menţionez acest lucru pentru ca utilizatorul interesat să ştie exact că pachetul cu dicţionare Uzuale nu este facultativ, deoarece aceste dicţionare fac corecţii ce nu sunt făcute de dicţionarele OCR_DIC.


      2. Opţiuni din pachetul OCR Plus pe care nu le folosesc.
      Din diverse motive - pe care le voi menţiona la fiecare opţiune în parte - câteva opţiuni din pachetul automat OCR Plus eu nu le folosesc.
      Iată care sunt opţiunile la a căror rulare am renunţat:

Code:

1.6 Conversii preliminare >> Rupere rânduri care încep cu dialog aflate în interiorul paragrafului
4.7 Corectare caractere reproduse eronat >> Conversie majusculă în minusculă la dialog francez
5. Marcare caractere
6. Ştergere caractere
10.1 Setări finale >> Înlocuire spaţiu după linia de dialog cu spaţiu neseparator

7.1 Înlocuieşte toate liniile de pauză cu: >> EmDash
7.3 Înlocuieşte toate liniile de pauză cu: >> Horizontal Bar
8.2 Înlocuieşte toate liniile de dialog cu >> EnDash
8.3 Înlocuieşte toate liniile de dialog cu >> Horizontal Bar


      Să le luăm pe rând:

      1.6 Conversii preliminare >> Rupere rânduri care încep cu dialog aflate în interiorul paragrafului
      Uneori această opţiune poate produce efecte nedorite şi să rupă un paragraf care în mod corect nu trebuie rupt. Sunt situaţii în care linia de pauză este redată eronat ca EmĐash. Dacă ea este este urmată de o majusculă, atunci în mod sigur softul consideră în mod eronat că este vorba de o linie de dialog şi rupe paragraful. Nu sunt foarte sigur pentru că nu am testat suficient, dar înclin să cred că acest lucru poate apărea chiar şi atunci cînd linia de pauză urmată de majusculă nu este EmDash.
      Am testat suficient această opţiune şi pot spune că se poate renunţa fără probleme la ea, deoarece cazurile în care este necesară ruperea reală a unui paragraf sunt foarte puţine, iar ruperea se face mult mai sigur pe timpul corecturii.


      4.7 Corectare caractere reproduse eronat >> Conversie majusculă în minusculă la dialog francez
      Această opţiune este depăşită şi se poate renunţa la ea, cu condiţia ca la setarea punctuaţiei să nu se activeze opţiunea de majusculare după semnele < ! > şi < ? >, ci doar după punct. [A se vedea setările Punctuaţiei, postate pe acest topic].
      Practic această opţiune a apărut atunci când setările de punctuaţie nu fuseseră definitivate, în sensul că la acel moment se făcea majuscularea după punct şi semnele < ! > şi < ? >.
      După acea s-au făcut modificări la punctuaţie şi s-au implementat mai multe opţiuni.
      Dacă la "Punctuaţie" nu se activează majuscularea după semnele < ! > şi < ? >, atunci nu mai apr situaţii de majusculară automată după semnele < ! > şi < ? >, deci opţiunea 4.7 nu se mai justifică.


      5. Marcare caractere
      Această opţiune, ca şi următoarea, a fost implementată printre primele. La acel moment aveam o problemă la convertirea ghilimelelor şi apostrofului în forma românească. la acel moment rămâneau în text o serie de ghilimele drepte sau apostrof drept, care trebuiau corectate pe timpul corecturii manuale. pentru a fi "mai vizibile" s-a propus marcarea color a lor. pe lângă apostrof şi ghilimele se mai pot marca şi diverse consoane individuale [care de regulă apar în locul semnului exclamării], toate tipurile de paranteze, precum şi alte caractere cunoscute de noi ca artefacte: ~ & = + % Ł # / \ > < *
      Între timp problemele legate de apostrof şi ghilimele au fost rezolvate, tilda ~ se modifică automat în cratimă, / înlocuieşte de multe ori litera z, iar caracterul \ înlocuieşte litera v, caracterul & poate apărea în locul literelor ă sau a... [multe dintre aceste aparaţii sunt corectate de dicţionare]...
      Deci, pe de o parte, multe din aceste probleme au fost deja rezolvate de dicţionare sau alte implementări ale programului.
      Pe de altă parte, experienţa ne arată că marcajul unor astfel de caractere are avantajul că le scoate în evidenţă, dar avem neşansa să nu mai observăm la fel de bine celelalte erori din text.
      În al treilea rând, uneori marcajele respective rămân în textul final pentru că persoana care face corectura nu le "vede" pe toate. Mai mult decât atât, marcajele inserează în text diverse coduri, şi de multe ori, deşi textul este "înnegrit" la corectură, rămân spaţii marcate color. pe de altă parte, pentru cei ce lucrează cu stiluri, aceste marcaje produc erori de stil. Ştergerea acestor marcaje este mai mult decât dificilă, astfel că în final rămân aceste coduri în text.
      În al patrulea rând, şi - probabil - cel mai important, respectivele coduri pot produce erori la convertirea textului în formatele pentru ereader şi tabletă.
      Din toate aceste motive, eu personal am renunţat de foarte mult timp la rularea acestei opţiuni.


      6. Ştergere caractere
      În general este vorba cam de aceleaşi caractere ca în opţiunea anterioară, numite de noi artefacte sau "răgălii".
      Ideea este următoarea: toate artefactele aflate la începutul sau sfârşitul paragrafului sunt şterse automat la opţiunea 1.7 cu dicţionarul CO_Artef.imd, deci ele oricum sunt deja şterse.
      Artefactele din interiorul paragrafului sau caracterele individuale ocupă de regulă poziţia unei litere sau a semnului exclamării. Am arătat deja că:
               caracterul    \  poate înlocui litera v,
               caracterul   /  poate înloci litera z,
               caracterul  &  poate înlocui literele ă, â, a...
      De regulă, artefactele care apar accidental în locul unor puncte sau pete în textura hârtiei [şi care ar trebui şterse] sunt foarte puţine; cele mai multe artefacte înlocuiesc în mod eronat o literă, o cifră sau un semn de punctuaţie.
      O parte dintre artefactele aflate în interiorul paragrafului, le-am avut în vedere şi am încercat să le rezolv în diverse dicţionare; de exemplu, multe caractere tipografice şi consoane independente de format fusiform sunt în realitate semnul exclamării... etc... etc... Dacă astfel de artefacte sunt păstrate în text au şansa să fie corectate pe timpul rulării AutoCorect; dacă sunt şterse va trebui să le inserăm pe timpul corecturii.
      În altă ordine de idei este mai uşor de văzut şi corectat un cuvânt care conţine un artefact în locul unei litere, decât un cuvânt din care a fost şters artefactul respectiv, deoarece prin eliminarea unui artefact dintr-un cuvânt ştergem practic o literă şi se poate obţine un nou cuvânt care poate fi corect [deci Word nu-l subliniază], dar nu este cuvântul real.
      Iată un exemplu:
             fragmentul de frază  "...el începu să se zbată şi apoi vorbi..."
             poate fi scris eronat  "...el începu să se /bată şi apoi \orbi..."
             dacă ştergem automat artefactele  /  şi \   textul obţinut va fi:
                          "...el începu să se bată şi apoi orbi..."
      Cred că sunteţi de acord că se poate trece cu relativă uşurinţă peste textul obţinut prin ştergerea artefactelor, fără a observa că textul nu este corect. Totuşi, zbate ≠ bate şi vorbi ≠ orbi.
      Din motivele de mai sus eu personal nu activez niciodată opţiunea 6. Ştergere caractere.


      10.1 Setări finale >> Înlocuire spaţiu după linia de dialog cu spaţiu neseparator
      Această opţiune NU TREBUIE ACTIVATĂ DE NIMENI.
      Motivul principal pentru care nu se activează opţiunea îl redau mai jos:
      În dicţionarele OCR_DIC cu modificare automată [deci nu cele cu confirmare] există câteva mii de înregistrări care fac modificări la început de dialog. Aş menţiona doar două mari tipuri de înlocuiri: I >> Î la cuvintele care încep în mod corect cu Î la început de dialog şi înlocuirile unor şiruri formate din cifra 1, precum 111 >> În, respectiv 1111 > Nu.
      Aceste înlocuiri sunt în număr foarte mare, câteva mii - aşa cum am arătat.
      Dacă s-ar activa opţiunea 10.1, aceste mii de înregistrări ar trebui să fie dublate ca număr, un pachet care să aibă "linie de dialog_spaţiu obişnuit" urmat de şirul de înlocuit, iar al doilea pachet ar trebui să aibă "linie de dialog_spaţiu neseparabil" urmat de şirul de înlocuit, ceea ce ar mări considerabil dicţionarele şi, implicit, timpul de rulare.
      În altă ordine de idei ar trebui să ţin minte ca orice înregistrare nouă care se referă la început de dialog să fie făcut în ambele forme şi fiecare înregistrare dusă la locul ei. Acest lucru nu este uşor şi sunt şanse ca uneori să uit să fac şi cea de-a doua înregistrare.
      Din acest motiv am hotărât să elimin toate înregistrările care conţin spaţiu neseparator şi să folosesc doar spaţiu obişnuit după linia de dialog.
      În concluzie, pentru cei care activează această opţiune, câteva mii de înregistrări nu vor face modificări.

      Cred că explicaţiile sunt suficient de clare.
      În afară de cele de mai sus, reamintesc faptul că spaţiul neserabil produce adeseori erori la convertirile în diverse formate pentru ereadere şi este convertit în caracterul < ? >.
      Dacă, totuşi, sunt persoane care doresc neapărat ca să înlocuiască spaţiul obişnuit de după linia de dialog cu spaţiul neseparator, pot face acest lucru în mod separat imediat după ce au făcut rularea tuturor opţiunilor şi dicţionarelor. reamintesc faptul că dacă opţiunea este activată de la început, câteva mii de înregistrări nu vor funcţiona.


      Referitor la opţiunile 7.1, 7.3, 8.2 şi 8.3 nu cred că este nevoie de prea multe explicaţii.
      Deoarece pentru a marca linia de pauză folosesc întotdeauna Endash [opţiunea 7.2], iar pentru linia de dialog folosesc EmDash [opţiunea 8.1], celelalte 4 opţiuni din aceste pachete rămân neactivate



      Mutarea opţiunilor neactivate.
      Când în meniul "OCR Plus" acţionăm asupra opţiunii "Rulează toarte funcţiile de corectare OCR", pe monitor este afişată fereastra "Rulare automată OCR Plus", care are forma unui tabel cu toate opţiunile ce pot rula în mod automat la pachet.
      Vom avea în acest, în funcţie de aprecierea fiecăruia, opţiuni active şi câteva opţiuni inactive.
      Ca să nu ne mai încurce opţiunile pe care nu dorim să le activăm niciodată, le putem coborî pe toate în partea de jos a tabelului, astfel încât să le separăm de cele active.
      Pentru a le putea muta, pur şi simplu agăţăm cu mausul opţiunea respectivă şi o tragem în partea de jos a tabelului, practic sub opţiunea 10.3. Procedăm similar cu toate opţiunile pe care am hotărât să nu le activăm. Eu am procedat astfel şi mi se pare că este mai uşor de lucrat şi de urmărit fiecare opţiune în parte.

      Iată cum apare fişierul meu "RulareAutomataOCRPlus.txt" din AppData:

Code:

1    1.1 Conversii preliminare >> Conversie dialog bullets în dialog text
1    1.2 Conversii preliminare >> Setare text la font şi mărime unică
1    1.3 Conversii preliminare >> Eliminare tab şi spaţii multiple
1    1.4 Conversii preliminare >> Eliminare spaţii la început şi sfârşit de paragraf
1    1.5 Conversii preliminare >> Repararea rândurilor rupte
1    1.7 Conversii preliminare >> Eliminare pagini (paragrafe) goale
1    2.1 Punctuaţie >> Eliminare paragraf-artefact
1    2.2 Punctuaţie >> Corectare linii de pauză şi linii de dialog
1    2.3 Punctuaţie >> Funcţii obişnuite
1    2.4 Punctuaţie >> Corectare suplimentară elipsis
1    2.5 Punctuaţie >> Conversie combinaţii ? ! şi . ,
1    3. Conversie text clasic în text contemporan
1    4.1 Corectare caractere reproduse eronat >> Corectarea majusculelor încorporate
1    4.2 Corectare caractere reproduse eronat >> Corectarea literelor l, d si m reproduse eronat
1    4.3 Corectare caractere reproduse eronat >> Corectare cuvinte foarte scurte
1    4.4 Corectare caractere reproduse eronat >> Corectare minuscule la început de paragraf
1    4.5 Corectare caractere reproduse eronat >> Înlocuire secvenţe cuvinte
1    4.6 Corectare caractere reproduse eronat >> Corectare cuvinte întregi şi expresii
1    7.2 Înlocuieşte toate liniile de pauză cu: >> EnDash
1    8.1 Înlocuieşte toate liniile de dialog cu >> EmDash
1    9. Rulare grup de dicţionare înlocuire multiplă
1    10.2 Setări finale >> Corectare cuvinte rupte
1    10.3 Setări finale >> Înlocuiri cu confirmare
0    1.6 Conversii preliminare >> Rupere rânduri care încep cu dialog aflate în interiorul paragrafului
0    4.7 Corectare caractere reproduse eronat >> Conversie majusculă în minusculă la dialog francez
0    5. Marcare caractere
0    6. Ştergere caractere
0    7.1 Înlocuieşte toate liniile de pauză cu: >> EmDash
0    7.3 Înlocuieşte toate liniile de pauză cu: >> Horizontal Bar
0    8.2 Înlocuieşte toate liniile de dialog cu >> EnDash
0    8.3 Înlocuieşte toate liniile de dialog cu >> Horizontal Bar
0    10.1 Setări finale >> Înlocuire spaţiu după linia de dialog cu spaţiu neseparator


      NOTĂ: Opţiunile marcate cu cifra 1 la început sunt opţiune active, iar cele marcate cu cifra 0 sunt cele inactive.

      Dacă până aici lucrurile sunt clare, voi continua cu o nouă postare în care voi arăta pe scurt cum fac eu rularea unui OCR în 3-4 etape.
      Dacă este ceva de clarificat, rog să puneţi întrebările de rigoare!
      Gaby [gaboy74], aştept un semn în acest sens.

      < sfărşit postare >


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#278
Seven
Moderator
Din: Ţara Perfectului Simplu

     Câteva cuvinte despre rularea dicţionarelor cu confirmare:


     Eu rulez complet toate dicţionarele, inclusiv pe cele cu mesaj, pentru a peria cât mai bine textul, astfel încât la corectura manuală să-mi rămână cât mai puţine erori, iar atenţia mea să se poată concentra nu numai pe depistarea erorilor de scriere a cuvintelor, ci şi pe topica frazei, pentru a depista şi alte erori decât cele vizibile la prima vedere.

     Ştiu că printre utilizatorii de AC există persoane care spun că nu au timpul şi răbdarea necesară pentru a rula toate înlocuirile cu confirmare; chestia cu lipsa timpului şi a răbdării este o treabă cu dus-întors.
     Dacă nu avem timp pentru rularea cu confirmare, vom câştiga timp la rularea în AC, dar vom pierde ceva mai mult timp la corectura manuală pentru a corecta bucată cu bucată fiecare eroare, care ar fi putut fi rezolvată la confirmări.

     Alte persoane spun că nu pierd timpul cu confirmarea în AC, pentru că preferă să facă înlocuirile direct în Word.
     Este şi aici o micuţă problemuţă: în primul rând în Word trebuie să edităm fiecare căutare, timp în care în AC aceste căutări sunt deja înregistrate; în al doilea rând, şi cel mai important, este o diferenţă foarte mare între modul de afişare al erorilor în AC faţă de Word şi anume: în AC eroarea apare afişată undeva în zona centrală a paginii, deci vedem cel puţin câteva cuvinte sau rânduri în faţa erorii marcarte şi astfel putem vedea foarte clar contextul în care apare cuvântul respectiv, astfel că este mai uşor să stabilim care este cuvântul real; în Word eroarea căutată va fi afişată, de regulă, pe primul rând al ferestrei, astfel că nu putem vedea cuvintele din faţa erorii şi uneori trebuie să defilăm un pic în sus pentru a vedea dacă este vorba de un cuvânt sau altul. De exemplu: cuvintele mină-mână, miner-mâner, fată-faţă, lotul-totul… etc… etc.; stabilirea corectitudinii unei variante sau alta se poate face doar analizând contextul în care apare respectivul cuvânt şi este foarte important să vedem toată propoziţia sau fraza, deci şi cuvintele din faţa erorii, cuvinte care în Word, de cele mai multe ori, nu sunt afişate.

     Nu vreau să afirm că metoda mea este cea corectă şi că altele sunt mai puţin corecte, ci am vrut, doar, să justific motivul pentru care eu folosesc din plin modificările cu confirmare din AC şi motivul pentru care în ultimul timp m-am ocupat în special de dezvoltarea acestor dicţionare.

     Obişnuinţa este mult mai importantă decât metoda optimă determinată cu instrumente de măsură.
     Un om lucrează aşa cum este el obişnuit şi aşa cum i se pare mai practic şi mai comod. Metoda cea mai bună pentru fiecare este metoda pe care o stăpâneşte cel mai bine şi pe care o poate perfecţiona.

     …Am dat aceste explicaţii pentru ca să nu mai pierdem timpul cu discuţiile despre utilitatea sau nonutilitatea şi prostia înlocuirilor cu confirmare.
     În legătură cu folosirea AC, fiecare este complet liber să procedeze aşa cum doreşte.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#279
menadel
MEMBRU VIP
Sevan, am și eu câteva înregistrări, nu știu dacă le-ai reparat, dar le postez. Eu pentru ele mi-am făcut o macrocomandă în word, dar tu știi mai bine cum să le pui în AC, dacă este cazul.
iară - fără -
tară - fără -
acm-acru
aeml-aerul
automl-autorul
cadavml-cadavrul
cârd-card
ceml-cerul
cmce-cruce
cmdă-crudă
comparațiv-comparativ
corăbie-corabie
fâșier-fișier
Flaide-Haide
Flai-Hai
fmnte-frunte
gmp-grup
Hali-Hall
informațic-informatic
Insă-Însă
juml-jurul
lacu-făcu
lăcea-făcea
lî-fi
lucm-lucru
Mărie-Marie
mga-ruga
negm-negru
pomnci-porunci
sacm-sacru
săbiei-sabiei
singuml-singurul
stâmea-stârneau
stâmind-stârnind
stâmi-stârni
stâmit-stârnit
stingă-stânga
tezauml-tezaurul
unna-urma
unnă-urmă
vmt-vrut

f des nn-rm
II la început de paragraf-Îl

baiatul-băiatul
extraterestri-extratereștri
dedt-decât
educațiv-educativ
tați-rari
Cari-Carl
Caria-Carla
Cariei-Carlei
laceți-faceți
lăcuse-făcuse
adevâr-adevăr
pârea-părea
râmas-rămas
bâiat-băiat
ma - mă -
tatâl-tatăl


_______________________________________
"Cand nu vom mai fi copii, nu vom mai fi deloc!"
Link la postarile vechi indisponibile https://yadi.sk/d/C7KtNd7syuV2B

 
   
#280
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Mulţumesc, Menadel! Sesizările tale îmi sunt de mare ajutor.
      Câteva dintre situaţii sunt implementate, cele mai multe nu.
      De pildă, deşi am multe înregistrări de tipul " m < > r n "...
      ...dar nu am înregistrări de tipul " n n < > r m " şi nici de tipul " r u < > m ". Aceste două grupuri va trebui să le analizez mai mult şi să găsesc şi alte combinaţii care trebuiesc corectate.

      Am salvat toate cuvintele şi am să le verific pe fiecare pentru a vedea dacă sunt deja înregistrate sau trebuie să le înregistrez.
      Am să vă ţin la curent.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#281
tuf
Vizitator



Multumesc pentru efort, Seven.

 
   
#282
Seven
Moderator
Din: Ţara Perfectului Simplu
***
     @tuf, dacăai intenţia să reactualizezi AC Portabil, te rog să n-o faci încă, deoarece în câteva zile am să urc varianta completată cu sugestiile colegului @Menadel.

     Referitor la ageste sugestii:
         - câteva situaţii [foarte puţine] erau deja implementate;
         - pe marea majoritate le-am înregistrat acum;
         - câteva [foarte-foarte puţine] sunt ceva mai dificile, deoarece ambele variante ale cuvântului pot avea frecvenţe mari; de exeplu: iară >> fără... mai cuget şi văd ce e de făcut.

      În legătură cu grupul de cuvinte: <stâng ≠ sting; stângă ≠ stingă; stângi ≠ stingi>:
      M-am gândit că e mai bine să schimb complet concepţia corecturii, similar cu <lingă ≠ lângă> şi <intre ≠ între>.
      Am constatat că <între> şi <lângă> sunt prepoziţii, iar <stâng, stnga, stângi> sunt adjective, timp în care perechile lor <intre, lingă, sting, stingă, stingi> sunt - toate - verbe.
      Expresiile de 2-3 cuvinte care conţin <între> sau <lângă> sunt în număr nedefinit, timp în care verbele <intre> şi <lingă> apar într-un număr finit de situaţii.
      Acelaşi lucru e valabil şi la adjectivele <stâng, stângă, stângi>: aceste adjective pot fi puse pe lângă un număr nedefinit de substantive, timp în care construcţiile care conţin verbul <a stinge> în formele <sting, stingă, stingi> au un număr finit.
      Deci, este mai uşor de modificat un verb în grup de cuvinte pentru că există un număr finit de forme.

      Până acum aveam înregistrări de grup cuvinte care modificau < sting, stingă, stingi > în < stâng, stângă, stângi >
      Am făcut următoarele modificări:
           - la opţiunea 4.3, în dicţionarul CO_S4.imd rulează automat 3 modificări şi anume: sting > stâng , stingă > stângă şi stingi > stângi.
           - la opţiunea 4.6, în dicţionarul CO_Expr1.imd se modifică construcţii verbale care conţin <sting, stingă, stingi>, astfel că <stâng, stângă, stângi> se modifică în <sting, stingă, stingi> în situaţii în care sunt precedate de:
                 [mă, îmi, te, îţi, o, îl, ne, vă, îi, le, se]
                 [să, să-mi, să-ţi,  să-şi, să-i, să-l, s-o, să o, să ne, să vă, să îi, să le]
                 [nu, nu-mi, nu-ţi, nu-şi, nu-i, nu-l, n-o, nu ne, nu vă, nu îi, nu le]
      E posibil să nu fi descoperit încă toate formele, dar principalele apariţii posibile în text sunt corectate.

      Am să revin când termin de înregistrat tote sesizările făcute.
      Dacă mai sunt colegi care au alte sesizări, vă rog să le postaţi acum pentru a le analiza şi înregistra în dicţionare înainte de postarea variantei reactualizate!


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#283
menadel
MEMBRU VIP
La varianta
iară - fără -
tară - fără -

eu am făcut macro așa:
la caută:
pauză iară pauză

la înlocuire
pauză fără pauză

Și la fel și la
la caută:
pauză tară pauză

la înlocuire
pauză fără pauză


_______________________________________
"Cand nu vom mai fi copii, nu vom mai fi deloc!"
Link la postarile vechi indisponibile https://yadi.sk/d/C7KtNd7syuV2B

 
   
#284
gaboy74
Membru Gold
Seven,

Eu unul multumesc mult pentru tutoriale.

Ce ar fi de clarificat la cat de clar e totul?

As vrea doar sa aduc in discutie cateva erori cu care ma confrunt cel mai des si care cred ca pot fi remediate in urmatorul update de dictionare

"tară"  cu "fără"  - este o eroare f des intalnita  - semnalata deja si de Menadel

"să între" cu "să intre", respectiv negatia "să nu între" cu "să nu intre" - la fel extrem de intalnita

Ţipi cu tipi si Ţipe cu tipe  - eroarea asta apare in special la autori contemporani nu imi aduc aminte sa fi aparut in "epoca clasica"

ia cu la - ar trebui pusa la inlocuire cu confirmare la fel cu cea de sus - apare f des.

si cuvintele semnalate deja de Menadel - educațiv(ă/e), comparațiv (ă/e), informațic (ă/e), comunicațive (ă/e)

in rest am observat ca pierd parantezele drepte [] , respectiv semnul &.

+ nu apare Î la inceput de propozitie in cadrul aceluiasi paragraf.

cam asta din partea mea.

Sa ne auzim cu bine
Gabi


 
   
#285
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      01.10.2016

      Am două semnalări la care mai cuget:
      Este vorba de: "iară >> fără"  şi "ia >> la".
      Atăt "iară" cât şi "ia" sunt cuvinte care apar în mod corect cu o frecvenţă foarte mare în text.
      Dacă pun înlocuire cu confirmare, situaţiile de refuz vor fi foarte multe şi înregistrările ar deveni agasante.
      Până la sfârşitul zile încerc să găsesc o soluţie [poate le pun în ultimul dicţionar - CO_Vt4] ca să se poată renunţa la ele fără a afecta alte înlocuiri.

      Ce-am rezolvat?
      Am implementat toate semnalările făcute de Menadel şi Gaby, cu menţiunile următoare:

      - în legătură cu "ţip, ţipa, ţipă, ţipe, ţipi...  >> < ţip, ţipa, ţipă, ţipe, ţipi...", am adăugat în dicţionarul Co_Vt1.imd o serie de înregistrări mixte, adică o parte dintre ele rulează automat, iar cealaltă parte cu confirmare; le redau mai jos:
           tipii, tipei, tipele, tipelor, tipul, tipului, tipilor – auto;
           un tip, unui tip – auto; tip – conf.
           tipa – conf.
           o tipă – auto; tipă – conf.
           unei tipe – auto; tipe – conf.
           unor tipi – auto; tipi – conf.
      Deocamdată le las aşa. Dacă înregistrările nu ne vor mulţumi, atunci ar mai fi o variantă ca să elimin confirmările pentru cuvintele "ţip, ţipa, ţipă, ţipe, ţipi" şi anume: le modific pe toate cinci în "tip, tipa, tipă, tipe, tipi..." şi apoi pun grup de cuvinte care conţin verbele "ţip, ţipa, ţipă, ţipe, ţipi", aşa cum am procedat la verbele: lingă, intre, sting, stingă, stingi. Problema rămâne în studiu.

      - în legătură cu secvenţele " n n >> r m"
      Am pus câteva cuvinte cu frecvenţă mare în dicţionarul Co_Var5.imd;
      Am făcut o serie de 81 de înregistrări cu confirmare a unor secvenţe de 4-5 litere care cuprind secvenţa corectă < r m >; mă refer la secvenţe de tipul:
           afirm, akerm, alarm, arma, armă, armân, arme, armi, armo, armu;
           ărma, ărme, ărmă, ărmi, ărmni, ărmu, ârmi, ârmo;
           berm, birm, borm;   cărm, cârm, cerm, corm, curm;
           darm, dărm, dârm; derm, doarm, dorm, durm;
           erma, ermă, erme, ermi, ermo, ermu;
           farm, fărm, ferm, firm, form, furm;   germ;   hărm, herm, horm;
           iorm, irma, irmă, irme, irmi, irmo;
           larm, lorm;   merm, morm;   norm;
           orma, ormă, ormâ, orme, ormi, ormo
           perm;   sărm, sârm, surm;   term, tirm, torm;   ţărm;
           urma, urmă, urmă, urme, urmi, urmo, urmu.
      Din păcate, toate sunt cu confirmare şi pentru a nu deranja foarte tare, le-am pus în dicţionarul CO_Vt1.

      - în legătură cu unele substantive proprii:
      Numele Carl, Carla, Carlei, dar şi câteva nume străine de persoane şi locuri precum Hall, Pall, Mall, München, Müller, Champs-Élysées, François... etc... le-am pus în Co_Vt1.imd

*************************

      În legătură cu alte câteva semnalări:
      - pierderea parantezelor drepte [] , respectiv a semnului &;
     În mod normal ele nu ar trebui să dispară dacă nu este activată opţiunea "6 Ştergere caractere". Am menţionat mai sus că această opţiune nu e bine să fie activată.

      - nu apare Î la inceput de propozitie in cadrul aceluiasi paragraf;
     Litera î mic se majusculează automat la opţiunea "2.3 Punctuaţie / Funcţii obişnuite", dar numai după punct. După semnele !, ? şi ... majuscularea nu se face automat, deoarece - în funcţie de context - sunt corecte şi situaţiile cu minusculă şi cele cu majusculă.
     Pentru a avea corectă această majusculare, rog revedeţi cap 3 din tutorialul postat la adresa: http://www.mediafire.com/?wfgpxiobovw55

     Deocamdată, cam asta e situaţia în legătură cu cele semnalate până acum.
     Dacă mai sunt şi alte situaţii, vă rog să le postaţi!     


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#286
gaboy74
Membru Gold
mersi Seven,

am sa verific setarile in AC

numai bine
gabi


 
   
#287
Seven
Moderator
Din: Ţara Perfectului Simplu
***
     Doar ca exemplu, am să redau pe scurt metoda mea de lucru de la OCR_Brut până la obţinerea versiunii [V1.0].


     ■ 1. PRELUCRARE ÎN ABBYY
Din Abbyy extrag textul în format DOC Exact Copy, având setat să-mi afişeze antetele şi subsolul pentru a obţine numărul de pagină. OCR-ul obţinut poartă menţiunea [BRUT].


     ■ 2. PRELUCRARE INIŢIALĂ ÎN WORD
     – deschid OCR_BRUT în Word 2003 şi rulez 3 pachete de macrocomenzi. Practic fiecare pachet conţine mai multe macrouri editate separat, dar sunt rulate cu o singură comandă în ordinea stabilită în macroul cumulativ al pachetului.
     – primul pachet se numeşte „DEL_FORMAT” şi face următoarele modificări: şterge chenarele frame, şterge marcajele de sfârşit de secţiune, sfârşit de coloană, sfârşit de pagină şi le înlocuieşte cu marcajul pentru paragraf. Pachetul mai cuprinde un macro care şterge cratima opţională, astfel că o parte dintre cuvintele rupte la cap de rând sunt lipite în această etapă; de asemenea, în pachet există şi macroul care converteşte caracterele bullets în caractere text.
     – al doilea pachet se numeşte „Format_Text” şi formatează minimal textul: format pagină, stabileşte caracteristicile stilului „Normal”: tip font, mărime font, margini şi aliniere paragraf, limba română… etc. Practic se elimină diversele mărimi de font, dar se păstrează caracteristicile regular, italic, bold şi combinaţii ale fontului.
     – al treilea pachet, „Punctuaţie” reglează minimal o serie de aspecte de punctuaţie şi spaţii multiple. Şterge spaţii în faţa sau după semnele de punctuaţie, converteşte tab şi spaţii multiple într-un singur spaţiu, şterge spaţii în faţa şi după paragraf.
     – dacă este nevoie şterg cu ajutorul funcţiei Find&Replace anteturile care conţin numele autorului şi/sau titlul cărţii. Spre a evita ştergerea accidentală a cuvintelor respective din text, ştergerea o fac prin confirmarea fiecărui caz în parte.
     – după rularea celor 3 macrouri, salvez fişierul în format RTF şi-i redenumesc menţiunea din [BRUT] în [OCR].


     ■ 3. PRELUCRARE ÎN AUTOCORECT OCR+
Pentru uşurarea muncii, rularea în AutoCorect OCR+ o fac în mai multe etape. În principiu, separ rularea automată de rulările cu confirmare, astfel:

           – prima etapă: rulez toate funcţiile care rulează automat şi nu necesită intervenţia utilizatorului.
     Practic setez pentru rulare toate opţiunile despre care am vorbit mai sus şi anume:

Code:

1    1.1 Conversii preliminare >> Conversie dialog bullets în dialog text
1    1.2 Conversii preliminare >> Setare text la font şi mărime unică
1    1.3 Conversii preliminare >> Eliminare tab şi spaţii multiple
1    1.4 Conversii preliminare >> Eliminare spaţii la început şi sfârşit de paragraf
1    1.5 Conversii preliminare >> Repararea rândurilor rupte
1    1.7 Conversii preliminare >> Eliminare pagini (paragrafe) goale
1    2.1 Punctuaţie >> Eliminare paragraf-artefact
1    2.2 Punctuaţie >> Corectare linii de pauză şi linii de dialog
1    2.3 Punctuaţie >> Funcţii obişnuite
1    2.4 Punctuaţie >> Corectare suplimentară elipsis
1    2.5 Punctuaţie >> Conversie combinaţii ? ! şi . ,
1    3. Conversie text clasic în text contemporan
1    4.1 Corectare caractere reproduse eronat >> Corectarea majusculelor încorporate
1    4.2 Corectare caractere reproduse eronat >> Corectarea literelor l, d si m reproduse eronat
1    4.3 Corectare caractere reproduse eronat >> Corectare cuvinte foarte scurte
1    4.4 Corectare caractere reproduse eronat >> Corectare minuscule la început de paragraf
1    4.5 Corectare caractere reproduse eronat >> Înlocuire secvenţe cuvinte
1    4.6 Corectare caractere reproduse eronat >> Corectare cuvinte întregi şi expresii
1    7.2 Înlocuieşte toate liniile de pauză cu: >> EnDash
1    8.1 Înlocuieşte toate liniile de dialog cu >> EmDash
1    9. Rulare grup de dicţionare înlocuire multiplă
1    10.2 Setări finale >> Corectare cuvinte rupte
1    10.3 Setări finale >> Înlocuiri cu confirmare


     Observăm că este activă şi opţiunea „10.3 Setări finale >> Înlocuiri cu confirmare” şi este corect, chiar dacă am spus că rulez doar opţiunile care rulează automat.
     Practic, computerul va „ronţăi” singur programul, rulând toate opţiunile şi se va opri la prima modificare cu confirmare din dicţionarul CO_Var4.imd. Menţionez că dicţionarul Var4 este un dicţionar hibrid, adică conţine în prima parte înlocuiri automate, iar în partea a doua înlocuiri cu confirmare care se referă la cuvinte rupte la cap de rând; de aceea este bifată şi opţiunea 10.3.
     Încă două menţiuni:
          – dacă avem o carte tipărită în limbaj contemporan, putem dezactiva  opţiunea „3. Conversie text clasic în text contemporan”, pentru ca programul să nu mai piardă timp fără rost.
          – se mai observă că opţiunea „9. Rulare grup de dicţionare înlocuire multiplă” este activă, deci vor rula şi toate dicţionarele Uzuale.

     Revenim. Am spus că programul va rula automat şi se va opri la prima opţiune cu confirmare; în timpul rulării automate putem să ne ocupăm de orice altceva, fără a fi nevoiţi să stăm în faţa calculatorului.
     În momentul când programul s-a oprit la prima modificare cu confirmare avem două posibilităţi: prima oprim programul şi salvăm, modificând numele fişierului prin înlocuirea menţiunii [OCR] cu [AC-], ceea ce înseamnă că am rulat AC parţial. Dacă nu suntem plictisiţi şi dorim să continuăm, atunci vom continua cu confirmările până la primul semn de oboseală/plictiseală şi oprim programul, procedând la salvarea şi schimbarea menţiunii în [AC-].

           – în a doua etapă vom rula manual şi rând pe rând dicţionarele CO_Var4÷CO_Var7. După ce terminăm cu aceste dicţionare, fişierul va putea purta menţiunea [AC+].

           – în a treia etapă vom rula manual şi rând pe rând dicţionarele cu confirmare Vt1÷Vt4 şi vom schimba menţiunea fişierului în [AC++].

           –în a patra etapă şi ultima, putem rula dicţionare personalizate şi dicţionarele cu mesaj de informare despre care am amintit în nişte postări mai vechi. După această ultimă etapă, fişierul poate purta menţiunea [V0.3] – de la versiunea 0.3 – sau [N0.3] – de la Necorectat 0.3. personal prefer să notez [N0.3] pentru a nu confunda din grabă [V0.3] cu [V3.0].

     Ce trebuie să reţinem despre dicţionarele cu confirmare?
     Dacă rulăm manual un dicţionar cu confirmare şi întâlnim o situaţie care conţine o eroare marcată, dar nu se poate corecta prin confirmare ci doar prin intervenţie manual, putem opri rularea cu ajutorul butonului [X] din partea de sus-dreapta a ferestrei şi pagina respectivă rămâne afişată exact acolo unde era eroarea.
     Acest lucru nu se întâmplă atunci când rulăm un pachet de opţiuni. Dacă rulăm un pachet de opţiuni şi oprim rularea, programul nu va afişa pagina cu eroarea curentă, ci altă pagină [probabil pagina unde s-a făcut ultima modificare.

     Personal, obişnuiesc să opresc de mai multe ori rularea unui dicţionar şi să reiau rularea, apăsând „Renunţ” pentru toate cuvintele pe care le-am corectat deja.
     Menţionez că la rularea manuală a unui dicţionar există şi opţiunea „De la înregistrarea selectată”. Această opţiune permite dicţionarului să continue rularea de la înregistrarea marcată de noi [prin simplu click pe ea], fără a mai relua înregistrările anterioare. Cu această opţiune există, totuşi, o problemă: dacă avem un dicţionar mai mic, opţiunea rulează perfect. Dacă este vorba despre un dicţionar mare, atunci opţiunea rulează la prima activare, dar nu mai rulează la următoarea, astfel că putem alterna: facem o rulare activând această  opţiune, apoi una cu opţiunea dezactivată, iarăşi o rulare cu opţiunea activată, apoi una cu ea dezactivată.


     ■ 4. PRELUCRARE ÎN WORD
          – deschid în Word ultimul fişier obţinut în AC şi-l salvez în format DOC; fişierul de tip DOC are avantajul faţă de RTF, deoarece permite salvarea diverselor formatări pe care RTF nu le salvează.
     În Word sunt două mari activităţi:
          – o prelucrare minimală a textului fără citire: formatări, evidenţieri titluri, corecţii pe diagonală, întocmirea Indexului de cuvinte rare şi crearea dicţionarului Word de tip „.dic” suplimentar etc.
          – corectura propriu-zisă pentru versiunea [V1.0].
     Nu vom intra în detalii mai amănunţite legate de aceste prelucrări, deoarece nu acesta este subiectul.

****************

     Dacă nu vor mai apărea alte sesizări, ceva mai târziu voi posta dicţionarele actualizate la 01.10.2016.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#288
Seven
Moderator
Din: Ţara Perfectului Simplu

      REACTUALIZARE  DICŢIONARE AC


      Dicţionare reactualizate la 01.10.2016

      Fişier-arhivă:  Cpl DIC AC [2016.10.01].rar  –  conţine dicţionarele OCR_DIC şi Dic.Uzuale.

      Adresă folder:  http://www.mediafire.com/?5y6jfas53fl7j  –  folder deschis mediafire
      Link direct:  http://www.mediafire.com/?bt5mpx43lthlo7f


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#289
tuf
Vizitator



cap. al XIV-lea > cap. Al XIV-lea

Am pregatit varianta portabila. Imediat ce imi dai un raspuns legat de ce e mai sus, urc si varianta portabila.


 
   
#290
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Problema "Cap./cap. Al >> Cap./cap. al"
      Corecţia este rezolvată de opţiunea "Modificări speciale de text / Modificare text corectat eronat".
      Cele două înlocuiri sunt înregistrate în dicţionarul CO_Vt.1.imd, la poziţiile 153 şi 154, astfel:
                 153    cap. Al    cap. al    Ci  Pp  Cli   
                 154    Cap. Al    Cap. al    Ci  Pp  Cli   

       Pentru cine nu ştie: Condiţiile    Ci  Pp  Cli    înseamnă: [Ci] Cuvânt întreg la ambele capete + [Pp] Potrivire perfectă + [Cli] Confirmare.

       Atenţie!...
       Reamintesc faptul că opţiunea independentă "Modificări speciale de text / Modificare text corectat eronat" este  la fel de importantă ca oricare dintre opţiunile care rulează automat.
       Practic, rularea acestei opţiuni este obligatorie.
       Opţiunea rulează 4 dicţionare, care au la acest moment un total de 7228 înregistrări active, astfel:
             CO_Vt.1 = 527 înregistrări active;
             CO_Vt.2 = 4000 înregistrări active;
             CO_Vt3 =  2479 înregistrări active;
             CO_Vt4 =  222 înregistrări active.

       Menţionez că cele 7228 de înregistrări sunt mixte, adică unele dintre ele rulează automat, iar altele rulează cu confirmare.
       De ce sunt ele amestecate?
       Pentru că majoritatea lor sunt înlocuiri de grupuri de cuvinte care conţin un anume cuvânt de înlocuit, iar dicţionarele sunt structurate în funcţie de aceste cuvinte.

       De exemplu:  fii >> fi în grup de 2-3-4 cuvinte:
       Modificările de genul "nu-ţi [nu-şi, n-aş, n-ar] fii >> nu-ţi [nu-şi, n-aş, n-ar] fi" rulează automat,
timp în care modificări de genul "n-ai [n-am, n-au] fii >> n-ai [n-am, n-au] fi" trebuie să fie cu confirmare, deorece formulările "n-ai [n-am, n-au] fii" sunt şi ele corecte, aşa cum sunt corecte şi formulările "n-ai [n-am, n-au] fi."

       Per total, procentul de înregistrări cu confirmare este de cca. 33% [am verificat acum], aşa că rularea opţiunii este mult mai uşoară decât pare la prima vedere.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#291
iris205
Membru Gold
Multumesc Seven pt toate instructiunile dar nu am reusit in Word sa gasesc functiile mentionate de tine, ar fi posibil sa atasezi aici acele pachete cu macrocomenzi?

 
   
#292
iris205
Membru Gold

tuf a scris:

Daca te referi la ultimul mesaj a lui Seven, e vorba de AutoCorect, nu de Word.


Nu ma refer la ultimul mesaj ci la mesajul:
"***
     Doar ca exemplu, am să redau pe scurt metoda mea de lucru de la OCR_Brut până la obţinerea versiunii [V1.0].
............................",

unde dupa Abbyy prima data preclucreaza textul in Word2003 si foloseste macrocomenzi.


 
   
#293
tuf
Vizitator



Exista niste comenzi de Word. Nu s-a mai vorbit de multa vreme despre ele.
Asteapta sa iti raspunda Seven.


 
   
#294
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      1. @iris205, am văzut şi am înţeles ce mă întrebi.
      Am să încerc în perioada următoare să detaliez problema. Există undeva pe forum un topic despre macrocomenzi şi acolo am să încerc să prezint în detaliu toate macrourile pe care le folosesc.


      2. În dicţionarul CO_Var7.imd sunt câteva zeci de înregistrări care se referă la convertirea ghilimelelor drepte-sus şi ghilimele româneşti de forma 66-sus în ghilimele româneşti de forma 99-sus.
      Toate aceste conversii erau înlocuiri cu confirmare.
      Pentru o mai rapidă şi comodă rulare a dicţionarului am modificat majoritatea conversiilor ghilimelelor şi le-am setat să funcţioneze automat, lăsând cu confirmare doar câteva situaţii în care ghilimele pot fi ghilimele de sfârşit sau ghilimele de început.
      Practic funcţionează automat toate modificările de pe lângă semne de punctuaţie, atât la sfârşit de paragraf, cât şi în interiorul paragrafului.
      În dicţionarele noastre se poate înlocui dor acest dicţionar CO_Var7.imd, celelalte dicţionare rămânând aşa cum le aveţi în prezent.

      Nume arhivă:  CO_Var7 [29.10.2016].rar
      Adresă download:  http://www.mediafire.com/?m3v6jj79epvhhp6


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#295
luiz25
Membru Puf
12 ian. 2017,
Actualizare pentru AUTOCORECT CONTEMPORAN de la softset.ro,
Dictionare imd - versiunea cu 350.000 secvenţe-erori corectabile automat.


Acest fisier arhivat contine o ALTA versiune a dictionarelor imd Autocorect - realizata independent -  la care lucrez de 4 ani.
Dictionarele imd contin peste 350.000 secvente-erori corectabile automat fara interventia userului. Plus peste 12.000 cu confirmare, pe care nu va sfatuiesc sa le executati, deoarece corectura cu aprobarea userului dureaza 4 ore/carte.

Pentru cei ce au deja instalat AUTOCORECT CONTEMPORAN de la softset.ro - dezarhivati si suprascrieti folderul OCR_DIC din aceasta arhiva - peste folderul OCR_DIC din calculatorul dv (ex. pt.  win7) :

c:\Users\YOUR USER NAME\AppData\Roaming\AutoCorect Contemporan\Dictionare\

Se recomanda ca Dictionarul imd (aflat in afara folderului OCR_DIC) numit Cifre-GHILIMELE.imd sa se ruleze dupa executarea pct. 1.7 din OCR PLUS – moment in care intrerupeti rularea OCR PLUS – urmand sa o continuati dupa ce ati terminat cu dictionarul CIFRE-GHILIMELE (putand relua fara probleme rularea OCR PLUS de la pct.1.1).
Acest dictionar “CIFRE-GHILIMELE.imd” executa inlocuiri cu confirmare STRICT PENTRU ghilimelele prost recunoscute si transformate de ABBYY in cifre (11, 14, 44, 46, 64, 66 si combinatii similare, cifre + slash / , asterisc sau apostrof)

Cu setarile OBLIGATORII precizate mai jos, NU AVETI DE FACUT INLOCUIRI CU CONFIRMARE (cu exceptia executarii dictionarului CIFRE-GHILIMELE), astfel ca programul va rula neintrerupt de la inceputul la sfarsitul documentului, FARA SUPRAVEGHEREA USERULUI.

Daca procesorul PC-ului dv este ceva mai slab (single-core), programul ruleaza foarte lent sau se poate bloca, astfel ca va fi nevoie sa desfaceti documentul  rtf in mai multe fascicule.
Pe procesoarele dual-core programul se descurca bine cu fisiere de 300 pag A5, font de 12, paragraf la un rand.

Setarile generale ale programului le aveti in pagina R.I.:
http://romania-inedit.3xforum.ro/post/4 ... ia-Inedit/

ATENTIE !

IN CADRUL setarilor generale, am modificat unele setari fata de pagina R.I. de mai sus – de aceea va rog sa luati in consideratie OBLIGATORIU urmatoarele:

1. Setarile de punctuatie

A. Mergem in meniul de sus Autocorect, la
INSTRUMENTE - CONFIGURARE - PUNCTUATIE - DOCUMENTE
- debifam APLICA PRINCIPIILE DE BAZA ALE PUNCTUATIEI.
- debifam MAJUSCULA LA INCEPUT DE FRAZA.
APLICA - INCHIDE.

B. In meniul vecin de langa DOCUMENTE - si anume OCR PLUS
(dau si calea completa - INSTRUMENTE - CONFIGURARE - PUNCTUATIE - OCR PLUS - MAJUSCULA) - din cele 6 casete ce se pot bifa - bifam de sus in jos numai caseta 1 (celelalte le debifam).
APLICA - INCHIDE.

IN ACEASTA CONFIGURARE a setarilor de punctuatie, frazele ce incep gresit cu litera mica vor fi lasate in mod nedorit neatinse, fapt ce nu ne deranjeaza prea mult, deoarece ele sunt foarte putine - in 99,9% din cazuri majuscula de inceput de fraza este recunoscuta corect.

IN SCHIMB, este corectata  POZITIV situatia cu ABREVIERILE de INSTITUTII ce contin punct (ex. F.B.I. ... U.R.S.S. etc) – cand fraza este continuata cu o litera mica. Eroarea initiala a constat in faptul ca  litera mica era transformata automat si NEDORIT in majuscule de catre pct. 2.3 OCR PLUS - care introducea automat majuscula dupa FIECARE PUNCT. ACUM aceasta eroare este rezolvata.

@2017. Am remediat si transformarea eronata a literei mici
- de dupa abrevierile cu litere mici – in majuscula.
Ex., literele marcate cu bold RĂMÂN aşa cum sunt in textul original:
Conventia p.s.d. urmează să aprobe candidatura.

2. Setări la OCR PLUS

Accesati meniul OCR PLUS - RULEAZĂ TOATE FUNCŢIILE DE CORECTARE OCR
In fereastra RULARE AUTOMATA OCR PLUS se vor bifa urmatoarele puncte:

- de la 1.1. la 3 inclusiv
- de la 4.2. la 4.6 inclusiv
- 5
- 7.2
- 8.1
- 9
- 10.2

3. Setarea pentru pct. 9 - Optiuni:
In aceeasi fereastra - RULARE AUTOMATA OCR PLUS:

- puneti mouse-ul pe pct. 9 deja bifat si accesati cu click stanga  tabul OPTIUNI din dreptul punctului 9 (Rulare grup de dictionare inlocuire multipla)
- se deschide mini-fereastra - RULARE DICTIONARE
- eliminati cu butonul - STERGE - TOATE DICTIONARELE prezente in aceasta mini-fereastra
- apasati butonul ADAUGA si cautati cu browse in folderul OCR DIC - numai dictionarele Co_Vt1.imd, Co_Vt2.imd, si Co_Vt3.imd

- dati click pe rand pe fiecare, si aceste dictionare vor fi adaugate in lista golita anterior.

NOTE:

1. Transformarea in litere a artefactelor si/sau stergerea lor se executa la pct. 2.2.
Acest punct 2.2 NU VA MAI FI RULAT dupa terminarea completă a rularii Autocorect, deoarece va modifica textul deja corectat - in mod NEGATIV.
Aceeaşi mentiune EXPLICITĂ şi pentru pct. 2.3.

2. Sub-punctele de la OCR PLUS care pot fi rulate din nou DUPĂ TERMINAREA INTEGRALĂ a corecturii automate cu OCR PLUS – si dupa alte eventuale corecturi manuale - fără a modifica NEGATIV corectura deja executată - sunt:
1.1 – 1.7
2.1
2.4 – 2.5

3. Am schimbat functia Punctului 6 din meniul OCR PLUS  - STERGERE CARACTERE - ce acceseaza dictionarul Co_Apco.imd, astfel:

Acest dictionar cuprinde contine peste 2.200 de secvente si ruleaza inlocuiri cu confirmare.
Executia lui poate dura pana la 4 ore, astfel ca il folosim doar in cazul fisierelor ce initial NU au diacritice.
In aceste cazuri se aplica mai intai diacriticele pe text - din meniul Autocorect lateral stanga (Aplica diacritice).
Acest dictionar (de la pct.6) poate fi folosit la inceputul prelucrarii de corectura automata a fisierului, mai precis - imediat dupa rularea punctelor de la 1.1 la 3 inclusiv - moment in care opriti rularea OCR PLUS - PROGRES RULARE OCR PLUS - din  butonul STOP.

LINK DOWNLOAD
https://www.mediafire.com/?qcd78gwswkd5dm2


 
   
#296
uciN
MEMBRU VIP
Poate AC rezolva un text ca cel de mai jos? Sau este nevoie de o macrocomandă VBA?

T e x t  d e  p r o b ă  p e n t r u   t e s t a r e a  p r o g r a m u l u i  a u t o c o r e c t.
Da c ă  tex t u l  pre z i n tă  spa ț i i  alea to rii  înt r e  ca rac t ere  aș a  cu m  a par e  a ic i ?


 
   
#297
luiz25
Membru Puf

uciN a scris:

Poate AC rezolva un text ca cel de mai jos? Sau este nevoie de o macrocomandă VBA?

T e x t  d e  p r o b ă  p e n t r u   t e s t a r e a  p r o g r a m u l u i  a u t o c o r e c t.
Da c ă  tex t u l  pre z i n tă  spa ț i i  alea to rii  înt r e  ca rac t ere  aș a  cu m  a par e  a ic i ?


AUTOCORECT nu poate obtine rezultate multumitoare in aceste cazuri.

Corectura porneste de la  ELIMINAREA SPATIILOR DUBLE (redundante) dintre cuvinte,
si nu elimina spatiile dintre litere unice.

Deoarece la OCR poate fi gresita orice litera dintr-un cuvant,
si orice litera poate fi inlocuita eronat cu ORICE alt simbol din cele peste 100 ale tastaturii,
pentru a acoperi toate variantele posibile ar trebui introduse in DICTIONARELE AUTOCORECT
miliarde de miliarde de secvente-erori.
Un singur cuvant de 7 litere poate avea sute de variante de recunoastere eronata.
Inmultiti cu cate cuvinte are DEXUL (peste 670.000 de termeni-intrare), si veti intelege.


CONSIDERATII:
1. Textul pare a fi rezultatul unei conversii din ACROBAT direct in WORD.
Recomandarea este ca OCR-ul sa se faca in ABBYY, deoarece
este foarte posibil ca recunoasterea sa se faca ok, fara spatii in plus.
2. E foarte posibil ca ABBYY PDF TRANSFORMER sa obtina rezultate perfecte.
3. Daca nu, extrageti TIF COLOR din PDF - la 600 dpi, cu 4000 pixeli verticala,
apoi faceti o prelucrare de imagine BATCH (in grup),
MARIND CONTRASTUL paginii (Exposure/CoNTRAST/GAMA),
si apoi introduceti TIFURILE in ABBYY FINEREADER.


 
   
#298
tuf
Vizitator



Asa este, de regula apare la conversia pdf > doc.
E mai sigur sa fie trecut pdf-ul prin Abby.


 
   
#299
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Sal'Tare!

      Îmi cer scuze! Deşi am urcat o reactualizare ceva mai nouă a dicţionarelor pe mediafire, am uitat să anunţ asta pe forum.
      Fac acum cuvenita menţiune:


      REACTUALIZARE  DICŢIONARE AC


      Dicţionare reactualizate la 17.07.2017

      Fişier-arhivă:  Cpl DIC AC [2017.07.17].rar  –  conţine dicţionarele OCR_DIC şi Dic.Uzuale.

      Adresă folder:  http://www.mediafire.com/?5y6jfas53fl7j  –  folder deschis mediafire
      Link direct:  http://www.mediafire.com/?8mq1a220c61u4rx

      Am în lucru ca primă urgenţă două categorii de probleme:
             – prima: un grup de nume franţuzeşti cu diacritice la care încă lucrez; grupul de nume l-am cam stabilit, dar caut variantele de erori posibile; de exemplu: dacă pentru François, eroarea poate avea două forme, adică Francois şi Frangois, ei bine pentru literele cu accent grav sau ascuţit există mai multe variante...
             – a doua: sunt acele secvenţe care conţin în mod eronat grupul "nn" [NN] în loc de "rn" [RM], ca în aNNament în loc de aRMament; Dat fiind că o mulţime de nume stăine de persoane conţin în mod corect dublu N, ceea ce am făcut până acum nu mă mulţumeşte; practic ar trebui să folosesc secvenţe mai lungi pentru a evita erorile secundare; am făcut eu ceva, dar mai este încă foarte mult de lucru... ştiţi cum e cu aranjamente de "x" luate de câte "n"... dacă o secvenţa de 4 litere o înlocueşti cu secvenţe de 5 litere, ţi-ai făcut de lucru pentru cel puţin o zi.

      Dacă din când în când mai semnalaţi nişte erori, ar fi perfect pentru a le rezolva la timp.

      Stimă şi să auzim numai de bine!

      Seven   


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#300
Stelevadris
Moderator
In versiunea portabila functioneaza fara probleme.
Ai marit cumva numarul de inregistrari? Am folosit de proba un text de 65 de pagini. Mi s-a parut ca s-a miscat un pic cam lent rularea dictionarelor.
Posibil sa fie totusi de la executabilul portabil.


_______________________________________
Totul despre cărți - About e-books - Tehnici de scanare, sfaturi, proiecte etc. - Support, future projects, etc.

 
   
Pagini: 1 ... 9 10 11 12 13 14 15  
Mergi la