Forum Romania Inedit
Romania Inedit - Resursa ta de Fun
|
Nou pe simpatie: runnyroxy la Simpatie.ro
 | Femeie 25 ani Suceava cauta Barbat 26 - 57 ani |
|
|
Forum Romania IneditReguliInregistrareLoginPozeNu sunteti logat. Lista Forumurilor Pe Tematici
|
| #126 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Mulţumesc Cosmin! Era una dintre probleme pe care uitam mereu s-o întreb. Am înţeles. În cazul ăsta se pot face mai puţine dicţionare.
Cu liniuţele... mă mai gândesc un pic la varianta implementării. Cred că ar trebui să fie prima opţiune care ar trebui rulată... dar nu sunt sigur. Există o problemă: frecvent apar situaţii când dialoguri scurte sunt "adunate" într-un singur paragraf. La corectura manuală sau la vizualizare ele sunt destul d uşor de remarcat deoarece sunt însoţite de liniuţa Em dash. În momentul în care toate liniile din text vor fi mai întâi convertite în cratimă, aceste dialoguri aflate din greşeală în interioarul paragrafului vor avea semnul cratimă şi, frecvent vor fi văzute ca liniuţă de pauză [explicativă]... Din cauza asta, deocamdată mă abţin de la convertirea tuturor tipurilor de liniuţă şi aş merge deocamdată doar pe "curăţarea" liniilor de dialog care sunt însoţite de răgălii.
Acum mai am o altă întrebare sau problemă. Practic mă interesează eliminarea tuturor tipuri de spaţii la început de paragraf: atât cele de tip Tab cât şi Spaţiu simplu sau spaţii multiple. Mă interesează dacă există opţiunea... Eu până acum am eliminat aceste spaţii cu ajutorul Word care-mi permitea să caute spaţii doar la început de paragraf; Acum se poate şi cu dicţionar de înlocuiri multiple, doar că nu "se vede" ce anume s-a înregistraz în dicţionar.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #127 |
|
|
M-am gandit la aceste spatii mai demult dar am fost totusi rezervat in a le scoate (mai ales cele de la inceput de paragraf). Dar daca zici ca o astfel de optiune ar fi folositoare, se poate implementa la punctuatie.
|
|
| |
|
| #128 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
|
| |
|
| #129 |
|
|
Da, e mai bine acolo. Ma gandesc sa implementez cu cod normal, nu cu imd-uri...
|
|
| |
|
| #130 |
|
|
Se pare ca exista o problema de dictionar. Corectarea literei L mic, reprodusa eronat ca 1, ! si I
A inlocuit să-l -> să-i
Cred ca la optiunea asta e nevoie de confirmare pe viitor.
_Cosimo_ a scris:
M-am uitat, Seven. O posibilă explicaţie s-ar găsi în ce ai făcut tu aici: https://docs.google.com/viewer?a=v& ... &hl=ro
Ai înlocuit să-1, să-! şi să-I cu "să-l", dar în multe cazuri ar trebui înlocuit cu "să-i".
Ideal ar fi ca autocorectul să fie folosit de fiecare dată cu confirmare, ca în corectorul din Word, nu automat, exceptând cazurile clare, gen "sînt-sunt" etc. E drept că ia mai mult timp, dar rezultatul e net superior. |
|
|
| |
|
| #131 |
|
|
Am implementat stergerea spatiilor si taburilor la inceput de paragraf. In ce priveste rezolvarea problemelor cu tipul de liniuta, deocamdata este bagata doar la punctuatie ca sugestie. Asta pentru ca: 1. nu exista un consens general pe Romania-inedit in privinta a ce tipuri de liniuta sa fie folosite in zone specifice(inceput de dialog, pauza in fraza, parte din cuvant); 2. Precizia unor astfel de inlocuiri automate va fi apropiata de 100% dar n-o va atinge niciodata.
|
|
| |
|
| #132 |
|
|
Scuze, era o mica problema cu scoaterea spatiilor la inceput de paragraf - a fost rezolvata.
|
|
| |
|
| #133 |
|
|
Am implementat ultima modificare (functia de scoatere a spatiilor la inceput de paragraf) si in versiunea Clasica. Ambele fisiere exe le gasiti la "centralizatorul" din prima postare din topic (prima pagina)...
Probabil maine dimineata voi scoate o versiune oficiala noua care, pe langa o parte din modificarile adaugate cu ajutorul vostru, va avea si mici optimizari la dictionare.
|
|
| |
|
| #134 |
|
|
Stimate domn, Va deranjez si eu cu o problema. Pe mine nu ma intereseaza reproducerea cartilor , ci numai textul, de aceea nu folosesc ABBYY pentru OCR. Programul pe care-l folosesc i-mi salveaza la iesire cartea intr-un fisier „txt”. Singura problema este aceea ca incurca, in mod aleatoriu, litera I (i mare) cu l (L mic) si invers. Am rezolvat partial problema (prin inlocuire multipla) in cazul cand apare I (i-mare in loc de L-mic) si l (L-mic in loc de i-mare - la expresiile scrise cu majuscule) in interiorul cuvintelor, dar nu am reusit o inlocuire automata in cazul primei litere dintr-un cavant. In cazul unei carti de sute de pagini trebuie facuta corectura manuala. Nu stiu daca problema mai intereseaza si pe altcineva, dar v-as fi recunoscator daca m-ati ajuta, macar cu un sfat. Atasez un exemplu: http://www.megaupload.com/?d=AAKRQQE2 Va multumesc anticipat.
|
|
| |
|
| #136 |
|
|
nichipercea a scris:
Stimate domn, Va deranjez si eu cu o problema. Pe mine nu ma intereseaza reproducerea cartilor , ci numai textul, de aceea nu folosesc ABBYY pentru OCR. Programul pe care-l folosesc i-mi salveaza la iesire cartea intr-un fisier „txt”. Singura problema este aceea ca incurca, in mod aleatoriu, litera I (i mare) cu l (L mic) si invers. Am rezolvat partial problema (prin inlocuire multipla) in cazul cand apare I (i-mare in loc de L-mic) si l (L-mic in loc de i-mare - la expresiile scrise cu majuscule) in interiorul cuvintelor, dar nu am reusit o inlocuire automata in cazul primei litere dintr-un cavant. In cazul unei carti de sute de pagini trebuie facuta corectura manuala. Nu stiu daca problema mai intereseaza si pe altcineva, dar v-as fi recunoscator daca m-ati ajuta, macar cu un sfat. Atasez un exemplu: http://www.megaupload.com/?d=AAKRQQE2 Va multumesc anticipat. |
--->
Indiferent daca folosesti Abbyy sau nu pentru OCR, problema semnalata de tine este frecventa, nu este ceva nou. Nu ai nici un avantaj in faptul ca salvezi in .txt, de fapt pierzi toate formatarile textului: mai exact inclinarea cuvintelor. Rezolvarea se face [dar nu total]:
- cand faci OCR-ul, indiferent daca-l faci cu Abbyy sau cu alt program, este bine sa ai paginile scanate la 300 dpi. - inainte de a face OCR-ul - in cazul lui Abbyy - trebuie "antrenat" astfel incat erorile constatate de tine sa fie cat mai mici. "Antrenamentul" acesta invata Abbyy ca acolo unde pune litera mare in mod eronat, sa puna litera corecta. - nici un program actual nu inlocuieste corectarea manuala a textului prin citire cap-coada.
_______________________________________ ---> "Eu nu am regrete, Iar dac-ai să-ntrebi ce-a rămas la mine, În inimă am urme de tine Regrete, eu nu am regrete..."
|
|
| |
|
| #137 |
|
|
BlankCd are dreptate, nu se poate elimina total corectarea manuala. Dar, pe langa metodele respective ce reduc numarul acestor erori, s-ar putea sa mai existe o alta solutie. De exemplu AutoCorect ar putea detecta ca nu e inceput de paragraf/propozitie/fraza si s-ar "intreba" de ce cuvantul respectiv nu e scris cu litera mica. Evident, nu ar merge in toate situatiile si e posibil sa strice in cazuri rare, de aceea trebuie folosita doar cand textul "abunda" de astfel de erori. E ca in gluma aceea cu meteorologii: daca previziunile lor se implinesc in proportie de 40%, ce-ar fi sa spuna pe invers si se vor implini 60%  In cazul AutoCorect, procentul va fi mai bun - inainte e 0%, dupa va corecta 90% si va strica 10%. Se pot face teste pentru a detecta procentul exact si dupa aceea se decide daca se merita implementata sau nu... Ideea e sa micsoreze munca manuala dupa corectarea automata si cred ca se poate.
Ce parere aveti...?
|
|
| |
|
| #138 |
|
|
ciuperca_cosmin a scris:
De exemplu AutoCorect ar putea detecta ca nu e inceput de paragraf/propozitie/fraza si s-ar "intreba" de ce cuvantul respectiv nu e scris cu litera mica. |
Cred ca ar fi ceva de genul cu confirmare la inlocuire: "vrei sa pui litera mica la inceputul acestui cuvant sau vrei sa las cuvantul sa inceapa cu litera mare?" Nu cred ca este utila decat in cazul in care face conversia automat din litera mare in litera mica urmata de corectarea automata a numelor proprii care incep cu litera mare. Daca ar fi cu confirmare ar trebui sa confirmi la zeci de mii de litere dintr-un document... ceea ce nu cred ca ar fi un castig de timp.
In cazurile in care astfel de greseli - cum este cazul si fisierului pus de nichipercea - abunda [sunt probabil mii si zeci de mii de astfel de litere eronate], solutia cea mai rapida este inlocuirea literelor mari cu litere mici in TOT documentul cu inlocuire automata, urmata imediat de inlocuirea automata a numelor proprii scrise cu litere mici cu nume proprii care incep cu litera mare. Evident ca vor mai fi cuvinte/nume proprii scrise cu litera mica dar acestea se rezolva la corectarea manuala astfel: cand incepi corectarea si gasesti un cuvant propriu care incepe cu litera mica il inlocuiesti prin metoda automata cu numele propriu care incepe cu litera mare. La inceputul corectarii textului vor fi multe asemenea inlocuiri dar pe masura ce avanseaza corectare aceste cuvinte vor fi din ce in ce mai putine.
Ar fi utila aceasta facilitate - daca programul s-ar "intreba de ce cuvantul respectiv nu e scris cu litera mica" - in cazul in care erorile in text NU sunt prea numeroase [in textul lui nichipercea nu cred ca ar castiga timp, fiindca erorile sunt multe], astfel incat confirmarea pentru inlocuirea literei mari cu litera mica, sa nu devina o corvoada si sa manance mult timp.
_______________________________________ ---> "Eu nu am regrete, Iar dac-ai să-ntrebi ce-a rămas la mine, În inimă am urme de tine Regrete, eu nu am regrete..."
|
|
| |
|
| #139 |
|
|
Nu vorbesc de inlocuire cu confirmare ci de inlocuire automata. Asta pentru ca ai dreptate, la numarul acela de erori e o munca imensa.
Adica: programul gaseste in mijlocul frazei un cuvant ce incepe cu majuscula. E vorba de anumite majuscule, nu de toate. De exemplu I de la Ion. Daca nu gaseste cuvantul in dictionar, verifica daca cuvantul rezultat prin inlocuirea I cu l (de la lunca) e scris corect. Daca da, il inlocuieste. Astea ar fi cazurile care ar fi destul de aproape de 100%. Ar putea fi si cazuri ambigue - in care cuvantul original e in dictionar. Aici trebuie testat sa nu strice mai mult decat repara respectiv daca numarul acestor erori e suficient de mic astfel incat sa fie mai eficienta inlocuirea cu confirmare.
Din pacate nu pot sa modific codul pentru a testa acum deoarece pe la 13 trebuie sa plec din oras pentru cateva zile. Unde plec n-am internet deloc si abia "palpaie" telefonul mobil. N-am nici laptop... Timp de o ora jumate voi mai raspunde aici pe forum. Daca intre timp se ajunge la un consens general ca se merita incercat voi modifica codul cand ma intorc.
|
|
| |
|
| #140 |
|
|
Daca eroarea este in interiorul cuvantului problema este simplu: - Orice litera urmata de I (i mare) se transforma in l (L mic); - Orice majuscula, urmata de l (L mic), urmata de orice majuscula se transforma in I (i mare). - Linie de dialog, urmata de spatiu, urmata de l (L mic) se transforma in I (i mare): - Mai pot face inlocuiri in cazul numelor proprii care incep cu I (i mare). Problema ramane pentru celelalte erori de la inceputul cuvantului. Raman cam 15-23 erori pe pagina. Pentru 100-150 de pagini n-ar fi o problema, sar cand ai peste 600 de pagini apar probleme, iti obosesc ochii. se mai blocheaza programul, trebuie sa intrerupi si sa te ocupi de altceva, etc. Multumesc.
|
|
| |
|
| #141 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Părerea mea este că la un număr aşa de mare de erori, practic dată de frecvenţa lui L mic şi I mare în limba română, corectura automată şi semiautomată este aproape imposibilă. Rămâne de verificat ceea ce a spus BlankCd mai sus: "antrenamentul la citire". În Abbyy există această posibilitate de a face antrenamentul [acomodarea] programului cu forma caracterelor. E adevărat că nu totdeauna programul ia de bun tot ceea ce i se recomandă, dar erorile sunt foarte puţine. De exemplu, dacă lui Abbyy i se "spune" de suficiente ori că ä=a, ü=u, ö=o ori că é şi č = e, programul va accepta acest lucru, fără prea multe erori. Practic acest lucru se face prin citirea supravegheată a câtorva pagini de carte. Probabil şi în programul de tip Recognito pe care-l foloseşti există o astfel de facilitate de a antrena programul cu caractere la care dă erori.
Pe de altă parte, mulţi dintre noi am încercat alte programe pentru extragerea OCR, dar în final ne-am întors la Abbyy. Deocamdată este cel mai bun.
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #142 |
|
|
--->
Daca deja a facut OCR la toata cartea... nu mai are rost sa mai scaneze inca o data cartea deoarece ii va lua 3-4 ore... In 3-4 ore deja are un text cu mult mai putine erori, daca prelucreaza textul automat:
- inlocuirea literelor mari cu litere mici - inlocuirea cuvintelor de dupa semnele de punctuatie: punct, semnul intrebarii, exclamarii; care incep cu litere mici. - inlocuirea cuvintelor proprii care nu au prima litera majusculata - inlocuirea cu litera mica a cuvintelor din dialoguri precedate de semnul intrebarii si exclamarii [ ex: " - Ma duc sa pun saua pe cal! Spuse Maurice" unde inlocuim Spuse cu spuse.... si alte asemenea] - scoaterea spatiului de dinaintea semnelor de punctuatie - alte prelucrari
Toate aceste prelucrari automate nu ii ia mai mult de 30 de minute... si va avea un text la fel de bun ca si cum Abbyy nici nu a avut acele erori masive. Cred ca daca studiaza cu atentie ghidul lui Aleph va gasi multe informatii. Si sa nu uit: a prelucra un text cu multe erori inseamna si nitica munca, nimic nu se face usor.
Poate sa faca si altfel daca doreste: incepe corectarea, iar unde gaseste greseala copie acel cuvant in Find si Replace il inlocuieste cu cuvantul corect in TOT documentul. Va fi greu pentru primele 40-50 de pagini apoi erorile vor fi mult mai mici ajungand undeva la 5-8 greseli pe pagina.
_______________________________________ ---> "Eu nu am regrete, Iar dac-ai să-ntrebi ce-a rămas la mine, În inimă am urme de tine Regrete, eu nu am regrete..."
|
|
| |
|
| #143 |
|
|
Am rezolvat, mi-a deschis ochii tatal meu. Faceam greseala ca voiam sa rezolv totul dintr-odata. In final am facut 5 machete de AutoCorect care se ruleaza succesiv: 1.- Se rezolva litera L-mic din interiorul cuvintelor (i-mare trece in L-mic); 2.- Se rezolva litera i-mare din interiorul cuvintelor cu majuscule (L-mic trece in i-mare); 3.- Se rezolva litera L-mic de la inceputul cuvintelor din interiorul frazei (i-mare trece in L-mic); 4.- Se rezolva litera i-mare de la inceputul cuvintelor din interiorul frazei (L-mic trece in i-mare pentru numele proprii); 5.- Se rezolva litera i-mare de la inceputul cuvintelor dupa linia de dialog (L-mic trece in i-mare). Se expota din AutoCorect intr-un format Word. - Se inlocuieste cu confimare L-mic cu i-mare pentru cuvintele de inceput de fraza dupa semnele de punctuatie ".", "?", "!", ":". - Se inlocuieste cu confimare L-mic cu i-mare si/sau i-mare trece in L-mic pentru cuvintele de dupa ghilimele. - Se inlocuieste cu confimare L-mic cu i-mare la cuvintele inceput de fraza (paragraf urmat de L-mic, trece in paragraf urmat de i-mare). Sfarsit. Cele 5 machete de AutoCorect, le-am denumit AutoCorect-1, AutoCorect-2, etc si le-am copiat in folderul unde este instalat programul. S-ar putea sa fie mai simplu, dar am rezolvat.
Referitor la program, este scump, dar zic ca se merita, problema "I-l" este singura eroare care o face. Mai greu este sa pregatesti pdf-ul pentru prelucrare. Ca sa fie un text continuu trebuie sa elimini eventualul antet si subsol (numarul de pagica), sa elimini imaginile. Pentu asta transformi pdf-ul in png, tiff, sau jpg (inainte se face crop pentru antet si subsol), dupa eliminarea imaginilor si a spatiilor libere (pagini goale, jumatati de pagina) cel mai bine se fac imagini alb-negru (dar nu e absolut necesar) si daca este necesar se accentuiaza textul, se face din nou pdf si se deschide programul. Se deschide pdf-ul si acum trebuie sa "inveti programul", se deschide o "lupa" pe care poti sa o faci mai mare sau mai mica astfel incat caracterul sau grupul de caractere sa fie cat mai clar, iar intr-o fereastra tastezi caracterul sau grupul de caractere din "lupa". Cel mai bine este sa-ti faci un document cu toate caracterele posibile. Dupa ce "a invatat" toate caracterele lucreaza singur. Dupa cum am spus pe mine nu ma intereseaza sa reproduc carti, ci sa am un text corect care se poate citi usor, se poate transforma in orice format se doreste. Iata rezultatul, din 134 MB a rezultat 477KB. http://www.megaupload.com/?d=QXJAK06X Multumesc mult pentru sfaturi, mi-au fost de un real folos.
P.S. Am observat un lucru extraordinar, daca se foloseste fontul "Calibri", nu este nici o diferenta vizuala intre textul necorectat si cel corectat: http://www.megaupload.com/?d=6NE4N1DT Oare se merita sa mai pierzi atata timp?
|
|
| |
|
| #144 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Îmi cer mii de scuze pentru cei ce au folosit dicţionarele L1 - L3 şi au avut parte de modificările în < că-l, dă-l, fă-l şi să-l > şi acolo unde trebuia să fie < că-i, dă-i, fă-i şi să-i >. Am descoperit ce greşeală am făcut. Practic, la înregistrările < că-1, că-! .... să-1, să-! > trebuia să setez "Cuvânt întreg" + "Păstrează capitalizarea" [Ci Pc] - ceea ce am şi făcut; în schimb, la înregistrările < că-I, dă-I, fă-I şi să-I > trebuia să setez "Cuvânt întreg" + "Potrivire perfectă" [Ci Pp], doar că eu am setat tot [Ci PC], astfel că s-a făcut înlocuirea atât la cuvintele < că-I, Că-I > ceea ce era corect, cât şi la < că-i, Că-i > ceea ce era complet incorect.
Am corectat dicţionarele L1.imd, L2.imd, L3.imd şi S1.imd, S2.imd, S3.imd, S4.imd. Am mai adăugat două dicţionare care se rulează din opţiunea "Înlocuiri multiple" 02 Linii dialog.imd - rezolvă circa 75 de forme de "recunoaştere" a liniei de dialog. 03 Scurte plus.imd - cuprinde câteva cuvinte scurte în care grupul < a m > este recunoscut eronat ca < a r n >. Dacă ultimul dicţionar se dovedeşte a fi util, înregistrările vor fi inserate în unul din dicţionarele S1-S4, pentru a putea fi rulate automat.
Dicţionarele de acest tip le voi actualiza permanent în prima mea postare de la pagina 1 a topicului. Menţionez şi aici adresele la zi:
Nume arhivă: Dictionare IMD L1-L3, S1-S4 PLUS - 2011.09.30.rar Adrese arhivă: http://www.mediafire.com/?6huea306bu7aa4a http://fbx.ro/7onmov0ftfqbgtfb
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #145 |
|
|
@nichipercea, in loc sa faci cinci machete cu Autocorect, vezi ca la 'salvare multipla' exista optiunea de salvare intr-un dictionar, fisier tip *.imt. Inca un sfat, pentru ce ai nevoie, cred ca mai util ar fi daca ai transforma pdf-ul in fisier tip .djvu. Are dimensiuni mici, poti citi usor textul si se pastreaza si aspectul de carte. Mai multe informatii gasesti aici:
http://romania-inedit.3xforum.ro/post/4 ... Pdf-jbig2/
Bafta!
|
|
| |
|
| #146 |
|
|
Am revenit... Ma bucur ca s-a rezolvat, nichipercea 
|
|
| |
|
| #147 |
|
|
Incă Încă Imi Îmi inteme interne să-i să-l ş; Şi stâmesc stârnesc a! al putemic puternic toamă toarnă atâme atârne ia la luminări lumânări iui lui sc se cl el
|
|
| |
|
| #148 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
Păi... să clarificăm câteva dintre cuvinte şi situaţii...
1. Unele dintre cuvintele de mai sus merg în dicţionarele de tip L sau S: cl - el — l-am trecut acum în S2 [Cuvânt întreg + Potrivire perfectă]; sc-se — este deja înregistrat în S2; iui-lui, respectiv ş;-şi ar putea fi înregistrate tot în S2 ca şi cl-el — trebuie urmărite dacă nu produc efecte secundare.
2. Unele cuvinte se pot trece în dicţionare de înlocuire multiplă, altele decât L şi S. Incă-Încă, Imi-Îmi, inteme-interne, stâmesc-stârnesc, putemic-puternic, toamă-toarnă, atâme-atârne, luminări-lumânări Se mai pot adăuga: clat-dat, clată-dată, cleci-deci, cleşi-deşi, clefel-defel, cleloc-deloc, clecât-decât, cles-des, clespre-despre, cleşert-deşert, clintre-dintre, clupă-după, clur-dur, În principiu este vorba de grupul < c l > care apare în loc de < d >; de asemenea mai e vorba de grupul < r n > care apare în locul literei < m > sau invers; uneori există rocadă şi între grupul < r i > şi litera < n >; mai pot apărea şi alte probleme... Acestea nu sunt reguli valabile la orice scanare; frecvenţa lor depinde de fontul folosit la tipărire, de gradul de apropiere a caracterelor [spaţiul dintre litere], vechimea cărţii, calitatea scanului etc. Mai ales, din acest motiv, aceste cuvinte trebuie puse în dicţionare de înlocuire multiplă, altele decât cele ce se rulează automat [L1-L3 şi S1-S4].
3. Există unele care nu pot fi implementate în dicţionare deoarece există ambele variante ale cuvintelor: să-i - să-l; [că-i - că-l, dă-i - dă-l, fă-i - fă-l] ia - la, a! - al Se mai pot adăuga: clar–dar, clin–din, clacă–dacă, Exemplificare: "a!... acum înţeleg" - deci poate apărea situaţia în care "a!" este corect; Acestea se pot corecta doar prin modificare cu confirmare individuală în Word sau AutoCorect.
Mii de scuze dacă au rămas unele inexaktitudini!... Cu stima! Seven 
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|
| #149 |
|
|
La dracu cu notificarile astea....
Asa e, mi-am dat singur de lucru cu grupul "a!", am facut inlocuiri fara sa precizez spatiul de inainte si de dupa grupul de caractere. Rezultatul a fost ca orice propozitie terminata in "a!" a devenit "al" Si nu am tinut cont de faptul ca tu folosesti strict inlocuirea automata.
Eu le adaugasem in template cu optiunea de notificare.
|
|
| |
|
| #150 |
SevenModeratorDin: Ţara Perfectului Simplu
|
|
*** Am început lucrul la ceva cărţi tipărite în perioada interbelică. E foarte multă muncă, deoarece ortografia folosită în perioada respectivă nu bate deloc cu cea de azi. Nu mai vorbesc de limbaj, care şi el este destul de diferit. M-am gândit să păstrez limbajul, dar să actualizez ortografia.
Ce anume aş dori să schimb? - înlocuirea apostrofului cu cratima; apostroful apare în majoritatea situaţiilor în locuri în care azi se foloseşte cratima; - eliminarea lui "u" final, care, am sentimentul că în multe situaţii era un "u" mut, deci avea numai rol ortografic. - înlocuirea lui "ie" şi "ă"cu "e" în multe cuvinte... etc. - despărţirea unor cuvinte, care atunci se scriau legate [dela, pentruce, pentru că..] - unirea unor cuvinte care atunci se scriau separat...
Sunt sigur că aceleaşi situaţii apar şi la alte cărţi tipărite în perioada interbelică; de aceea m-am gândit că ar fi bine să pregătesc nişte dicţionare cu aceste înlocuiri, spre a putea fi folosite şi în alte cazuri. Pentru a nu apărea efecte secundare, am hotărât să folosesc numai cuvinte întregi. Fiindcă numărul de cuvinte este imens şi necesită organizarea în multe dicţionare, iar rularea lor în mod clasic, unul câte unul, ar deveni greoie, am rugat pe Cosmin să mă/ne ajute cu o nouă opţiune de rulare automată.
Dacă mai lucrează cineva, în acest moment, la astfel de cărţi, aş fi foarte bucuros pentru o listă cu astfel de cuvinte, dar care au o frecvenţă relativ mare. Toate cele bune! Seven
_______________________________________
Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.
| TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK | | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA | | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY | | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |
|
|
| |
|