Simpatie.ro - matrimoniale
Forum Romania Inedit
Romania Inedit - Resursa ta de Fun
Nou pe simpatie:
Profil Andreea Miluta
Femeie
24 ani
Braila
cauta Barbat
30 - 48 ani
Forum Romania IneditReguliInregistrareLoginPozeNu sunteti logat. Lista Forumurilor Pe Tematici
Forum Romania Inedit / Totul despre cărți - About e-books /

[INTREBARI] Întreabă orice despre carti

Pagini: 1 ... 4 5 6 7 8 9 Moderat de Seven, Stelevadris, cuculean, naid, uncris
#151
bokken
Membru Gold
Din screenshot-urile pe care le-ai postat pe mobileread văd că soluţia narrow non-breaking space funcţionează pe Kindle Touch-ul tău!
Asta doreai, nu?


 
   
#152
utilitasetveritas
Pe lista neagra
A... scuze, discutia s-a terminat prin alte parti.
Da, narow non-breaking space e spatiul cu marime fixa pe care il cautam.
Non-breaking space-ul normal, aparent nu variaza ca marime (de aici si problema mea cu el), dar numai pentru ca il menajeaza unele programe si cititoare, practic el poate avea o marime aleatorie pe textele justified.

P.S.
Pe moment nu am apucat sa il testez pe Kindle Touch. Dar nu cred ca e vreo problema cu el.


 
   
#153
atari
Membru Junior
Salutare,
Are cineva poate un dictionar german-roman pentru Kindle?
Sau are cineva experienta cu crearea acestor dictionare, si e disponibil pentru o colaborare cu scopul generarii unui asemenea dictionar?
La ce ma gandesc mai exact, referitor la colaborarea asta:
- pornim de la:
  * D1 - dictionar german -> <limba_x>, care sa contina un numar cat mai mare de cuvinte si forme inflexionare
  * D2 - dictionar <limba_x> -> Romana, care sa contina un numar cat mai mare de cuvinte traduse
- facem un script/program care sa insereze in D1 traducerile din D2

Rezulta Dictionar german -> <limba_x>+Romana
Limba_x probabil ca e engleza sau franceza, depinde de ce e disponibil cu un numar cat mai mare de cuvinte.
Eventual facem scriptul configurabil si-l folosim si la <limba_y> -> Romana

Ma angajez sa pun umarul la scriptul/programul de mai sus, dar nu am nici un fel de experienta cu Mobi, despachetarea/impachetarea dictionarelor prc/mobi/azw. Nu am nici "materia prima" - cele doua dictionare de mai sus.

Suna interesant pentru colegii cu experienta in Kindle? Sau sunt pe langa gard cu propunerea de mai sus?

P.S.
Sigur, daca exista un asemenea dictionar disponibil - cu forme inflexionare, verbe separabile, der/die/das, samd, care sa se integreze in Kindle (adica sa poata fi accesat direct din carte prin selectarea cuvintului) - zic sarut-mana si-l folosesc pe ala!


 
   
#154
bokken
Membru Gold

atari a scris:

Ma angajez sa pun umarul la scriptul/programul de mai sus, dar nu am nici un fel de experienta cu Mobi, despachetarea/impachetarea dictionarelor prc/mobi/azw. Nu am nici "materia prima" - cele doua dictionare de mai sus.


Salutare şi ţie, herr Atari!

În principiu se poate ceea ce doreşti, cu un singur amendament: dicţionarul D2 nu va fi un dicţionar <limba_x> -> limba română ci unul limba germană -> limba română!
Ce zici, te descurci să faci scriptul să lucreze în condiţiile impuse? Cu alte cuvinte, scriptul trebuie să facă următoarele: pornind de la două fişiere .txt (UTF-8), reprezentând D1 şi D2 -> ia fiecare cuvânt din D1 -> verifică existenţa cuvântului şi în D2 -> copiază definiţia cuvântului din D2 -> lipeşte definiţia cuvântului din D2 în D1, imediat după definiţia aceluiaşi cuvânt din D1. Şi tot aşa până la epuizarea cuvintelor din D1.
Formele flexionare (pentru cuvintele din D1) vor fi introduse după mixarea celor două dicţionare apoi urmează generarea fişierului dicţionar .mobi!

Ca "materie primă" intenţionez să folosesc "Concise Oxford Duden German Dictionary, 3rd Edition" (DE-EN - aprox. 150.000 cuvinte) pentru D1 şi un dicţionar mai sărăcuţ (DE-RO - aprox. 13.500 cuvinte) pentru D2. Altceva nu am la dispoziţie pentru D2...

E OK aşa?

Dacă te hotărăşti, dă-mi de ştire pentru a-ţi pune la dispoziţie câte un fragment din D1 şi D2 - pentru testarea scriptului de mixare!


 
   
#155
atari
Membru Junior
Domnule Bokken, ne punem pe treaba!  Trimite-mi fisierele te rog.
Merge si asa cum zici tu, dar sunt doua potentiale probleme:
1. Formele flexionare care trebuie adaugate dupa aia. Ma refer la campurile <idx:infl> din specificatiile mobi. De unde le luam pe astea? De pus "la mana" nu e o solutie. Eu ma gandeam sa pornim direct cu un D1 care are info astea. :-) Sau e si o alta modalitate mai simpla/directa?
2. Numarul mic de cuvinte din dictionarul german-roman. Cred ca pescuim mai multi pestisori cu DE->EN->RO (daca sunt disponibile dictionarele de pornire, desigur).

Dar hai sa-i dam drumul intai la treaba asa cum propui tu si ne adaptam dupa aia la conditii si posibilitati.
Propun sa continuam "pe privat" operatiunea, e mai simplu de comunicat pe email/msg. Daca ajungem la un rezultat, dam aici de stire si altor utilizatori kindle. Intre timp, daca cineva are "materie prima"(dictionare) sau idei noi, rog sa posteze aici.


 
   
#156
bokken
Membru Gold
Nu-ţi face griji în privinţa formelor flexionare sau pentru orice altceva în afară de script. Dacă acesta îşi face treaba aşa cum am stabilit, de restul mă voi ocupa eu.

Alt dicţionar DE-RO nu am la dispoziţie şi mă îndoiesc că am putea găsi unul, aici cel puţin, judecând după interesul care i s-a acordat subiectului în aproape 24 de ore de la punerea sa pe tapet. Dacă se iveşte totuşi ceva, putem adapta din mers.

Da, ai dreptate în privinţa comunicării... Cred că cel mai probabil vom continua pe privat. Adresa aia de mail pe care o ştiu mai e valabilă? Dacă da, mâine dimineaţă (sper) o să-ţi trimit ceva ca să te apuci de lucru, împreună cu ceva mai multe detalii.


 
   
#157
atari
Membru Junior
"Nu-ti face griji" suna bine! (cred ca de vreo 30 de ani incoace nimeni nu mi-a mai dat sansa sa nu-mi fac griji! Nostalgic...)
Adresa de email e valida, astept sa fac stop pe piept la fisiere, cand ai timp de ele.


 
   
#158
_Cosimo_
Membru Senior
Dacă purcedeţi la o treabă atât de ambiţioasă şi demnă de toată lauda, ar trebui să folosiţi dicţionarul german - român de 1516 pagini de la Univers Enciclopedic de aici:
http://romania-inedit.3xforum.ro/post/3 ... RMAN_258_/

Descărcaţi toate versiunile de acolo şi vedeţi dacă se pot folosi. Dicţionarul arată excelent în versiunea pdf şi poate fi făcut un OCR foarte bun după el.

Luaţi legătura şi cu Aleph, el a făcut acelaşi lucru după dicţionarul englez-român de la Univers Enciclopedic şi are experienţa necesară.

Vă ţin pumnii!


 
   
#159
atari
Membru Junior
Salutare Cosimo,
Da, am pornit la treaba, in principiu merge, dar mai este ceva de lucru. Din pacate dictionarul scanat nu ajuta prea mult, pentru ca nu se poate corecta ocr-ul ca lumea daca nu cunosti foarte bine ambele limbi. Adica se poate teoretic, daca verifici cuvant cu cuvant, dar asta e oarecum diferit fata de lecturarea/corectura unei carti si nu cred ca se baga cineva la munca asta de chinez introvertit...
Multumesc oricum pentru idee.


 
   
#160
atari
Membru Junior
Am postat  in sectiunea "Forum Romania Inedit / Învățați limbi străine / Dictionare lba. GERMANĂ" prima versiune a dictionarului German-RomanGerman discutat mai sus:
http://romania-inedit.3xforum.ro/viewto ... 87#1473187



 
   
#161
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      atari,
      dacă vrei şi crezi că e mai vizibil sau mai bine, poţi deschide pe secţiunea "Învăţaţi limbi străine" chiar un topic dedicat dicţionarelor pentru Kindle.

      Chiar mă gândesc că am putea urca topicul sus, pentru că e vorba de contribuţie şi nu doar de un link cu ceva luat de undeva, deşi am impresia că topicurile puse sus sunt adesea mai puţin vizibile decât celelalte.

       În altă ordine de idei, cred că e bine să-i pui o versiune la dicţionar, de genul celor de la softuri... să zicem V.1.00
      Aş merge totuşi direct la V2.00 unde acel 2 ar însemna că avem două limbi [germană şi engleză]
      Dacă îi vei aduce îmbunătăţiri va fi o versiune V2.01 şi aşa mai departe.

      Dacă mai adaugi o limbă, atunci ar putea fi V3.01...
      Chestia asta este doar o idee... dacă nu vezi nimic util, o poţi ignora fără probleme.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#162
atari
Membru Junior
Seven, nu stiu ce sa zic despre topicul dedicat dictionarelor Kindle.... Nu vad un interes deosebit pentru subiect, si nici nu stiu cate alte dictionare ar fi de pus in topic. Un topic pentru un singur dictionar ar fi inutil.

De acord cu numarul de versiune, am adaugat-o la postare.
Numarul de versiune exista deja in metadatele fisierului mobi generat ( <dc : Description>Mama Omida die Alleswisserin v1.1</dc : Description> ).


 
   
#163
Seven
Moderator
Din: Ţara Perfectului Simplu
***
     Probabil că ai dreptate.
     Pentru moment s-ar putea să nu fie un interes pentru un astfel de dicţionar, dar eu constat că din ce în ce mai multe persoane îşi achiţionează un ereader, aşa că interesul ar putea să crească.

     Ca moderator al acelei secţiuni voiam să te asigur de toată disponibilitatea mea pentru promovarea dicţionarului.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#164
tdv
Membru Gold
Are cineva dicționar român pentru ABBYY varianta cu î din i în interiorul cuvântului?

_______________________________________
Tutorial docx în epub și mobi

 
   
#165
utilitasetveritas
Pe lista neagra
M-ar interesa si pe mine. Dar nu cred ca este.
Eu folosesc Abby 9 si nu are asa ceva.


 
   
#166
tdv
Membru Gold
Oare are cineva lista cu toate cuvintele din limba română și formele lor flexionare pentru a construi un dicționar pentr Abbyy? (Eu am lista dar fără formele flexionare)

_______________________________________
Tutorial docx în epub și mobi

 
   
#167
Seven
Moderator
Din: Ţara Perfectului Simplu
***
     Aş putea încerca să fac o asemenea listă, dar eu cred că nu merită efortul să-i ataşăm lui Abbyy un dicţionar aşa de mare.

     Să mă explic:
     Am menţionat undeva pe topicul de actualizare al AutoCorect că în folderul de instalare există dicţionarul DEX şi alte dicţionare româneşti, iar ele cuprind şi formele flexionare, dar şi forme arhaice şi regionalisme... etc... etc...
     Cosmin Cioupercă mi-a pus la dispoziţie un executabil cu ajutorul căruia se pot extrage toate cuvintele care încep cu o secvenţă, care conţin sau se termină cu o secvenţă de cuvânt.
     Executabilul îmi poate extrage lista cu toate cuvintele care încep cu litera a, apoi cu litera b, cu litera c... şi aşa mai departe, apoi eu aş putea uni aceste liste într-un dicţionar de tip "dic" în care cuvintele sunt listate unele sub altele.
     Extragerea pentru fiecare listă va dura câteva ore dat fiind numărul mare de cuvinte ce trebuiesc listate, dar lucrul acesta s-ar face o singură dată, aşa că nu contează.
     Deci, cel puţin teoretic, lista se poate realiza.
     Am reuşit să extrag acum lista cuvintelor care încep cu litera a: sunt 96.148 cuvinte.

     Inconveniente:
          - Dicţionarele din folderul de instalare au în total 181 MO, din care doar DEX are 61 MO, iar sistemul de scriere este unul fără spaţii; lista rezultată va fi mult mai mare deoarece sistemul de scriere este altul mult mai lejer.
          - Punerea la lucru de către Abbyy a unui astfel de dicţionar imens va încetini foarte-foarte mult viteza de citire- recunoaştere, iar OCR-ul va fi extras într-un timp mul-mult mai mare. Probabil vor fi inclusiv momente de blocare a computerului pe timpul citirii.
          - Din câte am constatat eu, nu lipsa unui dicţionar  complet este cauza principală a erorilor făcute de Abbyy, ci fontul folosit la tipărire şi calitatea scanării; acestea îl fac pe Abbyy să nu poată determina corect aria de citire a unei litere: din acest motiv el poate citi "n" în loc de "ri", ori "m" în loc de "rn" şi invers... şi multe-multe alte erori.

     Abbyy are oricum un dicţionar cu principalele cuvinte româneşti, deci nu are nevoie de un dicţionar complet.
     Cred că un dicţionar util ar fi un dicţionar al cuvintelor scurte care conţin diacritice; de regulă acestea sunt cuvintele care conţin multe erori.
     Pe de altă parte, scanarea trebuie să fie de calitate şi la o rezoluţie bună pentru ca Abbyy să "vadă" cât mai bine unde începe şi unde se termină fiecare literă. Dacă în imagine literele sunt lipite unele de altele, Abbyy nici măcar nu va putea apela la dicţionare pentru că eroarea este determinată de faptul că nu va "descoperi" despre ce literă e vorba.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#168
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Nu cred că am fost suficient de explicit, aşa că încerc să mai dau câteva exemple.
      Când suntem copii şi învăţăm să citim, noi "citim" litere pe care le asamblăm în cuvinte. Cu timpul începem să citim cuvinte sau grupuri mai mari sau mai mici de cuvinte şi nu mai pierdem timpul cu fiecare literă în parte. Din acest motiv uneori nu vedem greşeli de scriere pentru că de fapt citim ce ar trebui să fie scris şi nu neapărat ceea ce este scris în realitate. Este motivul pentrucare la corectură sărim peste anumite erori.

      Abbyy citeşte întotdeauna literă cu literă şi apoi asamblează cuvântul, apoi îl compară cu cuvintele aflate în dicţionarul său.
      Dacă unele dintre litere au puncte în care sunt lipite unele de altele, asta este cea mai mare problemă pentru Abbyy.

      În situaţia în care litera f are acel arc din partea superioară mai lat şi se întinde deasupra literei următoare, avem şansa să-l antrenăm pe Abbyy să citească grupuri de două litere,precum, fi, fa, fe, fo... etc. Până la urmă vom obţine un text corectabil.
      În situaţia în care fontul are litere cu "talpă", adică literele formate linii verticale au acea talpă în partea de jos [ori sus] iar tălpile literelor m, n, i, l, se unesc între ele, Abbyy nu va mai reuşi să stabilească locul precis unde începe şi se termină o literă. Cu cât sucesiunea unor astfel de litere este mai lungă, cu atât Abbyy va face mai multe erori şi va "găsi" litere care nu există în cuvânt.

      Să luăm ca exemplu un m urmat de ceva; dacă va selecta mai puţin din litera m va face cel puţin două erori: prima este că nu va recunoaşte litera m, ci doar un n sau ri, apoi bucata rămasă o va lipi de litera următoare şi ar putea găsi un "v" acolo unde el nu există...
     Pentru că la citire a pornit deja cu o "coadă" a literei m este foarte posibil ca la această coadă să adauge doar o parte din litera următoare, iar partea a doua a acestei litere o va lipi de litera care urmează... până va descopei un punct clar în care literele sunt despărţite unele de altele.
     Cuvântul rezultat nu mai contează dacă va fi căutat sau nu în dicţionar deoarece acest cuvânt este oricum foarte "departe" de ceea ce ar trebui să fie.

      Ideea este că în primă etapă Abbyy face citirea şi în etapa imediat următoare face comparaţia cu cuvintele din dicţionar.
      Dacă citirea este foarte proastă, comparaţia cu dicţionarul nu mai foloseşte la nimic.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#169
utilitasetveritas
Pe lista neagra
Corect. Totul depinde de calitatea scanarii si a paginii de carte. Singurul loc in care un astfel de dictionar ar fi util ar la verificarea ortografica manuala, pagina cu pagina, a erorilor din Abby, pe partea de cuvinte necunoscute de Abby adica.

 
   
#170
tdv
Membru Gold
Am ajuns la concluzia ca aveti dreptate. Multumesc pentru sfaturi!

_______________________________________
Tutorial docx în epub și mobi

 
   
#171
KEYKO
Membru Junior
Se pot importa dictionarele (dexb.dic si cele imd)  din autocorect in MS Word? Si cum?

 
   
#172
atari
Membru Junior
Despre lista de cuvinte si forme flexionare in limba romana:
Am extras o lista cu toate cuvintele si formele flexionare din baza de date de la dexonline.ro, probabil cel mai complet dictionar roman existent la liber - de fapt o colectie de dictionare : DEX-uri, Litera, neologisme, arhaice, regionalisme, samd.
Sunt 2 probleme cu listele astea de cuvinte si formele lor flexionare:
1. Diacriticele sunt scrise sau cu cedila sau cu virgula (una din doua)
2. Cuvintele sunt scrise doar in grafia noua (â din a, sunt) sau doar in grafia veche.
In cazul celor de la dexonline: virgule, grafie noua.

Pentru a genera un dictionar care sa recunoasca si cedile si virgule, si â din a si î din i, e nevoie ca lista de forme flexionare sa fie extinsa cu formele de mai sus (cedile, virgule, â, î ). Asfel, cuvantul va fi gasit in dictionar oricare ar fi forma lui concreta de scriere in textul cautat.

Lista extinsa - cu variatiile explicate mai sus:
http://www.mediafire.com/download/vbqum ... rms-RO.zip


Lista cu forme flexionare e in formatul folosit de proiectul dsl2mobi, am generat-o asa pentru ca intentionam sa fac si un dictionar roman-german ptr Kindle (sora lu' "Mama Omida die Alleswisserin", aia ramasa in tara - "Mama Omida Atoatecunoscatoarea" ).
Dar m-am oprit deocamdata din lipsa de material de intrare...

Daca aveti nevoie de formele flexionare in alt format, acesta se poate genera relativ usor din fisierul asta.

Seven, despre lista de cuvinte scurte cu diacritice despre care ziceai mai sus ca ar fi utila: cum definim un cuvant scurt? 3 litere? 4 litere?
Intreb pentru ca pot sa extrag eu lista asta.


 
   
#173
tdv
Membru Gold
La ABBYY 9 îi o problemă că nu lasă prea multe cuvinte care au aceeiași secvență, zice Dictionary overflow. Adică dacă urmează de foarte multe ori cuvinte care încep spre exemplu cu redev (redevelopare, redevenire, redeveniseți ș.a.).

_______________________________________
Tutorial docx în epub și mobi

 
   
#174
Seven
Moderator
Din: Ţara Perfectului Simplu
***
      Dicţionare... cuvinte scurte... limbaj clasic şi contemporan... diacritice cu sedila sau cu virgulă...
      Discuţia despre aceste aspecte este necesară şi cred că ar trebui să deschidem un topic special pentru astfel de discuţii.

      În urmă cu câţiva ani, atunci când s-a discutat pe forum despre o anume uniformizare a tipului de text aveam o singură dilemă: limbaj clasic sau contemporan.
      Erau doar diacritice cu sedila şi Word recunoştea doar cuvintele scrise cu astfel de diacritice.
      Între timp lucrurile s-au complicat din cauza celor două variante de diacritice, iar Word nu ne ajută deloc în sensul ăsta.


      Cuvinte scurte...
      @atari, am folosit expresia de "cuvinte scurte" în lipsă de ceva mai bun.
      În realitate încercam să mă refer la cuvinte cu mare frecvenţă în limba română care sunt de regulă cuvinte scurte.

      De fapt, "cuvinte scurte cu CRATIMĂ"...
      În postarea de mai sus am scris greşit "cuvinte scurte cu DIACRITICE. Voiam să mă refer la "cuvinte scurte cu CRATIMĂ.
      Lucrând în AutoCorect OCR Plus am constatat că cele mai multe erori apar la cuvinte scurte cu cratimă. Am tras concluzia că o cauză posibilă ar fi că Abbyy nu cunoaşte aceste cuvinte.
      Aici lucrurile sunt ceva mai clare: avem cuvinte formate din 2-5 litere plus cratimă, precum: m-a, mi-a, mi-au, mi-aţi. La acestea s-ar mai adăuga cuvintele compuse cu într-, dintr-, printr-. Probabil că mai sunt alte câteva situaţii pentru cuvinte mai lungi.
      O listă cu astfel de cuvinte o pot extrage eu din dicţionarele AutoCorect.
           
      Referitor la sensul de cuvinte scurte şi cu frecvenţă mare...
      Eu am pornit iniţial de la cuvinte din 3-4 litere, dar există şi serie de cuvinte cu frecvenţă mare ceva mai lungi: acolo, adică, nişte, decât, foarte, pentru, câteva, cândva, totuşi... aceasta, aceeaşi, fiindcă, câteodată, niciodată.......

      Putem crea un astfel de dicţionar, dar nu cu nişte criterii pur matematice, de genul cuvânt format din 5 litere, ori 6, 7 sau 8 litere.

      Cred că ar exista o posibilitate de realizare a unui executabil care să facă o căutare în funcţie de cea mai mare frecvenţă, dar eu nu mă pricep la programare.
      Dacă într-un text s-ar putea găsi cuvântul [succesiunea de caractere] care apare de cele mai multe ori în acel text, înseamnă că vom găsi cuvântul cu cea mai mare frecvenţă.
      Notăm acest cuvânt şi apoi îl eliminăm din text.
      Facem următoarea căutare şi vom găsi cuvântul care s-ar clasa pe locul 2 la numărul de apariţii.
      Îl notăm şi apoi îl eliminăm şi căutăm în acelaşi mod cuvintele următoare.

      Ştiu că e o chestie foarte complicată, dar eu m-aş băga la o astfel de muncă.
      Pe principiul căutării şi eliminării fac eu căutări în texte pentru dezvoltarea dicţionarelor AC.
      La un moment dat vom aveaun dicţionar de cuvinte cu frecvenţă mare, dicţionar pe care-l va putea folosi orice user în ce scop şi domeniu doreşte el.

      La momentul ăsta există pe net o listă cu 300 de cuvinte care au cea mai mare frecvenţă, doar că acea listă mai trebuie periată şi îmbunătăţită prin adăugarea de alte cuvinte.
      Cred că dacă am ajunge la o listă 1000 de cuvinte [fără cratimă], bine alese, scopul ar fi atins.


_______________________________________

     Oameni şi popoare îşi cată libertatea; după ce-o obţin, îşi caută stăpân.


     | TORENTE | Tăunul | ROCAMBOLE+ | FLORIS | VRACIU | Victor HUGO | J.F. COOPER | PAPILLON | POLDARK |
     | Dictionare Lba RO | | Gramatica RO | D. Stănoiu | Zaharia STANCU | H.Y. STAHL | V.CORBUL & E.BURADA |
     | Ultimul regat | Millennium | Shantaram | Pearl BUCK | Anchee MIN | Amy TAN | C. LÄCKBERG | Ph.GREGORY |
     | Extraterestrii şi Intraterestrii | RUFOR | Demonul Roşu | Vraja milioanelor | Cărţi audio |

 
   
#175
atari
Membru Junior
Asta cu Dictionary overflow e cam nasoala...
Seven zicea ca nu merită efortul să-i ataşăm lui Abbyy un dicţionar aşa de mare, dar cu eroare de mai sus asta devine  "nu e posibil să-i ataşăm lui Abbyy 9 un dicţionar aşa de mare".
Singura chestie care s-ar putea incerca e să-i ataşăm lui Abbyy un dictionar selectiv, daca este cazul, de exemplu cuvintele scurte cu diacritice.

@Seven
"Cred că ar exista o posibilitate de realizare a unui executabil care să facă o căutare în funcţie de cea mai mare frecvenţă."
Sigur, e posibil. Nu e nevoie neaparat de un executabil de sine statator, sunt diferite metode posibile pentru a obtine asta: VBA direct din MS word, scripturi (perl sau altceva)...
Problema e "cautare in ce?" In textul unei carti anume? Acumulare de rezultate dintr-un numar de carti?
Eu inteleg in principiu ce zici tu, dar programarea e in mare masura matematica (si intr-o oarecare masura - mult mai mica - inspiratie si poezie :-) )
Deci trebuie definite chestii clare pentru a obtine rezultate...

Discutia e interesanta, dar poate nu isi are locul aici. Un topic nou?


 
   
Pagini: 1 ... 4 5 6 7 8 9  
Mergi la