📢 Loạt tính năng mới: Kết nối tài khoản Diễn Đàn với toàn bộ Thư Viện (Truyện/Thơ/Nhạc/Phim/Ẩm Thực)
Xin chào cả nhà!


Ban quản trị vừa hoàn tất một loạt tính năng mới, kết nối tài khoản Diễn Đàn với toàn bộ các khu vực Truyện, Thơ, Nhạc, Phim và Ẩm Thực. Xin tổng kết lại để mọi người tiện theo dõi và sử dụng:

1. Đăng nhập dùng chung toàn site
Chỉ cần 1 tài khoản Diễn Đàn, đăng nhập một lần là dùng được ở mọi khu vực. Nút "Đăng nhập / Đăng ký" đã thay cho "Giới thiệu / Trợ giúp" cũ ở đầu mỗi trang.

2. Thảo luận ngay dưới tác phẩm
Mỗi truyện, bài thơ, bài hát, phim, món ăn giờ có khung bình luận riêng ngay trên trang đọc/nghe/xem - không cần qua diễn đàn mới góp ý được. Bình luận đầu tiên sẽ tự tạo 1 chủ đề trong mục "💬 Thảo Luận Tác Phẩm Thư Viện" để mọi người cùng trao đổi.

3. Theo dõi tác phẩm
Bấm "🔔 Theo dõi tác phẩm" để nhận thông báo qua email ngay khi truyện có chương mới.

4. Yêu thích & Lịch sử đọc
Đánh dấu "⭐ Yêu thích" các tác phẩm ưng ý, và hệ thống tự ghi lại "🕘 Lịch sử đọc" mỗi khi bạn ghé đọc/nghe/xem - đồng bộ theo tài khoản, xem lại bất cứ lúc nào trong menu thành viên.

5. Huy hiệu hoạt động
Một vài huy hiệu nhỏ (bình luận viên, người theo dõi, người sưu tầm, thành viên kỳ cựu...) sẽ tự xuất hiện trên hồ sơ khi bạn hoạt động tích cực - hoàn toàn không phải hệ thống điểm/tiền thưởng, chỉ mang tính ghi nhận cho vui.

6. Ghi công người đóng góp
Tên người đăng nội dung (đánh máy, sưu tầm...) giờ sẽ tự động liên kết về hồ sơ Diễn Đàn nếu trùng với một tài khoản đang có trên diễn đàn.

7. Báo lỗi nội dung
Phát hiện lỗi chính tả, thiếu nội dung, ảnh hỏng... trong lúc đọc? Bấm "🚩 Báo lỗi nội dung" ngay trên trang, không cần rời khỏi tác phẩm đang xem.

8. Cải thiện giao diện trên điện thoại
Đầu trang và khu vực diễn đàn đã được chỉnh lại cho gọn gàng hơn trên màn hình nhỏ.

Rất mong nhận được góp ý thêm từ cả nhà để hoàn thiện dần. Cảm ơn mọi người đã luôn đồng hành cùng Việt Nam Thư Quán!

Diễn Đàn » Hỏi Ðáp Tin Học

Cho tôi hỏi về VnDocR

14 trả lời, 1.966 lượt xem — Trang 1 / 1
VnDocR là phần mềm nhận dạng tiếng Việt. Mọi người có thể sử dụng phần mềm này để chuyển đổi tiếng Việt từ ảnh ra txt
Phần mềm này khá tiện dụng cho việc convert ra txt tiêng Việt, nhất là các truyện trong thư quán.
Hiện pmềm này có ver 3.0, tuy nhiên bản demo của nó không cut, copy được, vì vậy tôi hiện có bản demo 2.0.
Điều tôi muốn hỏi là tôi đã dùng cái bản demo 2.0, nhận dạng được ảnh qua scan mà không nhận dạng được ảnh thông thường (ví dụ tui print screen một đoạn txt xịn thành ảnh bmp hay tif, nhưng không thể nhận dạng được), cái này là rất quan trọng, bởi vì những file pdf lấy về từ thư quán chỉ có thể save vào dưới dạng ảnh thui
Có phải là do độ phân giải (dpi ) không phù hợp chăng, cái vndocr xài độ phân giải 300dpi, ảnh thường là 96dpi, tui đã convert lên 600dpi mà cũng k0 được (ảnh quét là 600dpi)
Hay là vndocr chỉ nhận được ảnh vectơ chứ không phải ảnh bitmap (tui k0 chuyên về xử lí ảnh nên k0 rành cái này lắm, k0 biết convert ảnh bitmap ra vectơ ntn)
Bạn nào đã xài cái này rùi (vvn chẳng hạn) help me với, nếu dùng được thì việc convert ra txxt cho thư quán sẽ nhanh hơn nhìu, k0 cần phải kì cạch gõ lại nữa.
HELP ME!
Đăng nhập để trả lời
0
Chời ơi, mấy ngày rùi mà k0 thấy ai trả lời hết, mọi người đi đâu hết cả rùi
Đăng nhập để trả lời
0
Cái nì TT chưa từng sài nên không thể giúp bạn được [8D]. Tuy nhiên bạn xem ở đây coi có giúp gì cho bạn được không http://vnthuquan.net/diendan/tm.aspx?m=9012
Còn không bạn hãy chờ người khác giúp bạn nhé [:)]
Đăng nhập để trả lời
0
Cái này thì Tovanhưng cũng vừa gửi cho Ct.Ly đây

Nếu CtLy sử dụng tốt, thì cho conbo2 biết nhé, nhưng có gì Ct.Ly sẽ nhờ Tovanhung hoặc VVN vào trả lời cho Conbo2 nhé

Chúc (Con bò hay con bọ vậy?? luôn dzui [;)]
Đăng nhập để trả lời
0
<Bài viết đã được chỉnh sửa lúc 2005-09-05 17:42:11conbo2>
Cái vndocr tôi xài được với file ảnh scan vào, vấn đề tôi thắc mắc là tôi muốn đọc văn bản từ ảnh thường (ví dụ từ các file pdf truyện TASS được quyền tuyên bố mà Thái Nhi gửi lên, file pdf thì chắc phải chuyển sang dạng ảnh (file này là nén các ảnh đã scan rùi, tạo file ảnh lần nữa chắc chất lượng càng tệ hại)), ví dụ như tôi print screen một đoạn txt ra ảnh bmp, đưa vào vndocr không nhận được.
Có ai đã dùng vndocr đọc văn bản từ ảnh thường (không phải ảnh scan) cho tôi ý kiến với
Rất cảm ơn các bạn ToTam, ctly( có phải là Cao Tiệm Ly không nhỉ) đã có phản hồi.

Ooop, trả lời xong rùi mới thấy bài của Thái Nhi
Việc convert txt từ file PDF thì con bò tui lạ gì, mở mã file PDF thì cũng đơn giản thôi (có tool sẵn) [:D], còn convert ra mà không có font thì cũng ngồi khóc thôi [:D]
Cái chính là như ở đoạn trên tôi đã nói, muốn convert ra txt từ các file truyện mà bạn và mọi người scan cơ.
Câu trả lời cuối của bạn "Hầu hết các chương trình đi kèm máy scan đều cho mở file PDF và save ở dạng TIFF" nghe hay đấy, mình sẽ thữ xem thế nào (chỉ tội cái ctrình kèm máy scan của minh cũ quá rồi, có thể không có chức năng đó, nếu bạn có cái chương trình tự convert được PDF ra TIFF thì giới thiệu cho mình với)
Đăng nhập để trả lời
0
Conbo va các bạn thân mến!

về thắc mắc của Conbo, trong hiểu biết của mình, tovanhung xin trả lời như sau: Không thể chuyển sang dạng text từ file ảnh theo kiểu chụp ảnh màn hình (Print Sreen).

VnDOCR là chương trình nhận dạng tiếng Việt có dấu (khác với những phần mềm nhận dạng văn bản - OCR khác là không dấu), vì thế, VnDOCR có nguyên lý hoạt động riêng. Đó là, nó sẽ nhận dạng và chuyển đổi ra text đối với những file scan từ text. Bạn dùng chức năng chụp ảnh màn hình, ghi lại ký tự thì cũng chỉ là bức ảnh có chứa ký tự, VnDOCR không tài nào hiểu được nó là text để chuyển mã. Đòi hỏi này là quá sức. Ngay cả anh chàng nhận dạng text rất mạnh như snagit cũng không làm được điều này.

Tóm lại, để nhận dạng được tiếng Việt, bạn phải dùng VnDOCR scan văn bản, có thể save lại theo dạng file .tiff hoặc .vpw rồi dùng chính nó để chuyển đổi ra text thì mới được.

Những file như pdf cũng không thể chuyển đổi được mà phải dùng phần mềm riêng.

Bài viết hướng dẫn chuyển đổi tất cả định dạng file đã được mình viết rất cụ thể trong www.thuvien-ebook.com, bạn nào có nhu cầu xin sang đấy tham khảo!
Thư viện sách điện tử tiếng Việt phong phú: www.thuvien-ebook.com
Đăng nhập để trả lời
0
Oooop, thế àh, xin cảm ơn tovanhung nha
Như vậy cuối cùng kết luận là không làm được việc đó
Có lẽ do ảnh scan vào là ảnh vectơ, còn ảnh chụp từ màn hình là ảnh bitmap chăng, (hồi trước học môn xử lí ảnh ông thầy có nói đến phần này rồi, nhưng không để ý nên không nhớ) có tool nào convert ảnh bitmap ra vectơ không nhỉ?
Thôi vậy, đành ngồi gõ truyện vậy, khi nào rỗi lại gõ vài trang đóng góp cho anh em thư quán [:D]
美しいマウス, あなたを愛している
-------------------------------------------
Con bò là ai, con bò là ta
Học hành biếng nhác thành ra con bò

Đăng nhập để trả lời
0
Trích đoạn: conbo2

Oooop, thế àh, xin cảm ơn tovanhung nha
Như vậy cuối cùng kết luận là không làm được việc đó
Có lẽ do ảnh scan vào là ảnh vectơ, còn ảnh chụp từ màn hình là ảnh bitmap chăng, (hồi trước học môn xử lí ảnh ông thầy có nói đến phần này rồi, nhưng không để ý nên không nhớ) có tool nào convert ảnh bitmap ra vectơ không nhỉ?
Thôi vậy, đành ngồi gõ truyện vậy, khi nào rỗi lại gõ vài trang đóng góp cho anh em thư quán [:D]


Việc gõ văn bản là chẳng đặng đừng. Nếu bạn có file văn bản là pdf,.Lit,.prc... thì hoàn toàn có thể chuyển qua text được. Còn nếu là sách in thì dùng VnDOCR để san cho nó nhận dạng tiếng Việt, nhanh hơn ngồi gõ từng chữ rất nhiều!

Thư viện sách điện tử tiếng Việt phong phú: www.thuvien-ebook.com
Đăng nhập để trả lời
0
Hưng đã trả lời khá đầy đủ cho conbo. Tuy nhiên nếu sách "hay" quá mà mình lại gõ chậm như cò mổ thì mình có cách "đi vòng" thế này. In các ảnh đó ra giấy. Sau đó scan lại các trang đó. Không cần phải dùng phần mềm đi kèm máy scan. Bạn có thể dùng ngay chức năng "Document Scanning" của Microsoft Office để scan và lưu lại dạng.tiff. Nên nhớ là VnDOCR chỉ làm việc được với các scanfile "Black & White" có độ phân giải 300 dpi hoặc 400 dpi only.

Về việc bạn Mọtsách nêu trong link của Tố Tâm về việc VnDOCR nhận dạng có nhiều lỗi và phải tạo các Macro để sửa chỉ là một cách đối phó và "sửa sai". Căn bản là nếu font của văn bản chưa có trong tự điển của VnDOCR, đương nhiên nó sẽ không nhận dạng hay "phiên dịch" được. Bạn dùng chức năng "Học" chừng vài trang rồi update training file của nó. Sau đó mới cho nó làm việc "Nhận Dạng" để convert. Bạn sẽ thấy độ chính xác tăng lên rất nhiều. Version 3.0 của VnDOCR chẳng quan chỉ thêm Font Unicode và update tự điển thêm nhiều font hơn mà thôi.

Trăm hay không bằng tay quen. Nếu bạn dùng VnDOCR một thời gian tự nhiên sẽ có kinh nghiệm. Mình tin rằng nếu dùng VnDOCR "properly" thì nó sẽ nhanh hơn đánh máy nhiều.
Đăng nhập để trả lời
0
Câu trả lời của vvn là chính xác!
Vẫn có thể dùng những cách đơn giản để nhận dạng từ print screen bằng VnDOCR. Mình đã làm thừ, và không có gì phải bàn cãi.
VnDOCR có hơn khác biệt. Không phải ảnh TIFF nào nó cũng nhận dạng cả đâu, kể cả bạn đã tăng độ phân giải lên trên 400dpi, bởi vì modul xử lý ảnh của VnDOCR hoạt động khá kém. Đó là lý do vì sao mình dùng mẹo bằng cách cho 1 chương trình OCR khác đọc file đó, rồi save lại dạng TIFF riêng của các chương trình nhận dạng. Do modul của các chương trình này tốt hơn, nên VnDOCR sẽ dễ dàng đọc được. Bạn thử xem sao.
Tuy nhiên, sự đời không như thế!
Bởi tỷ lệ nhận dạng không đều! Bạn có thể thấy đối với các sách ở Box Hiệu đính, tỷ lệ nhận dạng cao hơn rất nhiều so với box Đánh máy. Mình đã cố ý phân định ra như vậy cho tiện cả đôi đàng. Bạn nào đánh máy quen cho rằng đánh máy nhanho hơn hiệu đính. Bạn nào chậm, chưa quen thì thích hiệu đính. Ai cũng có phần cả[:D]
Đăng nhập để trả lời
0
<Bài viết đã được chỉnh sửa lúc 2005-09-08 10:16:43conbo2>
Mọi người vào trả lời nhiều quá.
Vấn đề của mình đúng như Thái Nhi đã đề cập, đó là muốn chuyển đổi các file pdf trong phần "đánh máy " sang txt. Mình dạo này khá bận, không có thời gian để gõ txt (chứ mình là dân tin nên trình gõ cũng không tồi đâu), do vậy muốn dùng vndocr để chuyển.
Thấy Thái Nhi gợi ý dùng một OCR khác chuyển file Tiff rồi quay trở lại nhận dạng, bạn có thể giới thiệu cho mình một cái ocr nào tốt được không (ví dụ cái mà bạn đang dùng ấy) ?
Còn về phần gọi là "sửa chính tả"(hiệu đính), mình không rõ mục đích phần đó làm gì, tại sao vẫn có file pdf ở trong đó (file scan), mình tưởng rằng phần sửa chính tả là sửa chính tả các file txt mà mọi người đã đánh máy chứ , Thái Nhi có thể giải thích rõ ràng hơn cho mình về phần đó không?
美しいマウス, あなたを愛している
-------------------------------------------
Con bò là ai, con bò là ta
Học hành biếng nhác thành ra con bò

Đăng nhập để trả lời
0
Chương trình mình đang sử dụng là ABBYY FineReader của Nga. Dùng khá tốt! Nhưng kinh nghiệm, hầu hết các chương trình đi kèm máy là dùng được.
Box Hiệu đính là nơi chủ yếu dành cho OCR. Hầu hết các tác phẩm rõ, có tỷ lệ nhận dạng cao đều chuyển qua đây. Như vậy công sức đánh máy sẽ tiếp kiệm được khá nhiều, và những bạn mới làm quen với bàn phím cũng dễ tham gia hơn.
Đó là lý do vì sao phải gửi kèm bản PDF, để các bạn có thể đối chiếu được với bản chính.
Quy trình kiểm tra chính tả được áp dụng cho cả box Đánh máy lẫn Hiệu đính. Một tác phẩm khi chuyển text được các quản trị viên gửi về vị trí đầu tiên, nơi gửi file PDF (việc này dùng để xác nhận phần đó đã hoàn tất, ghi danh người gửi text, tránh trùng lặp các bản đã gõ). Sau đó, các quản trị viên kiểm tra lần cuối trên forum, đọc lại tác phẩm trước khi đưa vào thư viện. Cuối cùng mới gửi đi.
Như vậy, việc tách ra box Hiệu đính thực chất là một hình thức phân công công việc mà thôi.
Đăng nhập để trả lời
0
À, thế thì con bò chậm hiểu này hơi hơi hiểu ra rồi đó
Góp ý Thái Nhi nên đặt tên hai phần là convert và type chứ, cho đỡ nhầm lẫn.
Mà vào phần convert sao không có truyện gì mới vậy, conbo định lấy về convert nhưng không thấy có gì mới hết [:D]
美しいマウス, あなたを愛している
-------------------------------------------
Con bò là ai, con bò là ta
Học hành biếng nhác thành ra con bò

Đăng nhập để trả lời
0
Rất đơn giản! Thông lệ diễn đàn ta là cố gắng dùng Việt hóa càng tốt. Vì vậy, thay vì dùng tiếng Anh để diễn đạt, ta dùng "ao ta" vậy.
Còn về mục "convert", trước đây mình đảm nhận luôn phần post PDF và convert. Nếu có thêm conbò thì sau nay mình sẽ nhẹ hơn rất nhiều[:D]. Conbò nhận luôn phần convert nhé (như topic Lịch sử Trung Quốc í)
À quên, dạo này mình quá bận rộn nên không còn thời gian để scan. Có gì conbò scan và hướng dẫn các bạn scan lên nhé![:D]
Đăng nhập để trả lời
0

Trích đoạn: conbo2

VnDocR là phần mềm nhận dạng tiếng Việt. Mọi người có thể sử dụng phần mềm này để chuyển đổi tiếng Việt từ ảnh ra txt
Phần mềm này khá tiện dụng cho việc convert ra txt tiêng Việt, nhất là các truyện trong thư quán.
Hiện pmềm này có ver 3.0, tuy nhiên bản demo của nó không cut, copy được, vì vậy tôi hiện có bản demo 2.0.
Điều tôi muốn hỏi là tôi đã dùng cái bản demo 2.0, nhận dạng được ảnh qua scan mà không nhận dạng được ảnh thông thường (ví dụ tui print screen một đoạn txt xịn thành ảnh bmp hay tif, nhưng không thể nhận dạng được), cái này là rất quan trọng, bởi vì những file pdf lấy về từ thư quán chỉ có thể save vào dưới dạng ảnh thui
Có phải là do độ phân giải (dpi ) không phù hợp chăng, cái vndocr xài độ phân giải 300dpi, ảnh thường là 96dpi, tui đã convert lên 600dpi mà cũng k0 được (ảnh quét là 600dpi)
Hay là vndocr chỉ nhận được ảnh vectơ chứ không phải ảnh bitmap (tui k0 chuyên về xử lí ảnh nên k0 rành cái này lắm, k0 biết convert ảnh bitmap ra vectơ ntn)
Bạn nào đã xài cái này rùi (vvn chẳng hạn) help me với, nếu dùng được thì việc convert ra txxt cho thư quán sẽ nhanh hơn nhìu, k0 cần phải kì cạch gõ lại nữa.
HELP ME!


Cái này chắc là conbò rùi[:D]!
Nói về các file PDF, có 2 cách để chuyển text:
1-Dùng chính các chương trình PDF để đưa về dạng text (như Adobe Acrobat). Đôi khi file PDf bị khóa mã, cần phải mởp mã ra trước (giống như hack đấy!
2-Nhưng đôi khi không hack được, hoặc file dùng font riêng không thể convert ra (cái này Mic đụng hoài[:D]), thì đành dùng một chương trình OCR để mở nó ra và save trở lại dạng TIFF B&W. Vấn đề còn lại là dùng VnDOCR như bình thường.
Hầu như các chương trình đi kèm máy scan đều cho phép mở file PDF và save ở dạng TIFF được
Đăng nhập để trả lời
0