<Bài viết đã được chỉnh sửa lúc <Edited by: <b>Mọt Sách</b> -- <b>10/30/2003 4:46:03 PM </b> >>
Thấy các bạn bàn luận chuyện sử dụng VNDOC để tiết kiệm công sức đánh máy nên MS viết bài này để nêu nên những ưu khuyết của nó để các bạn tham khảo !
Mình là người tâm huyết với việc đưa tác phẩm từ trang giấy lên mạng từ rất lâu nên cũng để công tìm tòi xem có công cụ nào có thể chuyển được chữ việt từ dạng ảnh image sang dạng text không !
Vài năm trước mình đã thử sử dụng các chương trình nhận dạng ký tự của nước ngoài để thử nhận dạng ký tự việt, nhưng tất nhiên là không được vì các chương trình này không nhận biết được các dấu của tiếng việt, rồi mình cũng biết tới chương trình VNDOC từ khoảng 2 năm trước đây, tất nhiên là mình chỉ biết tới bản Demo của nó thui.
Phải công nhận là tuyệt vời, khi đang cố công tìm mà kiếm được thì sướng đến độ nào không nói thì các bạn cũng biết![[:D]](/images/smiley/s2.gif)
Trong khi chưa mua được bản nghiêm chỉnh ( còn chờ các bạn kêu gọi đóng góp) thì các bạn có thể thử trước bằng bản DEMO của VNDOC bản 2.0
với bản DEMO này các bạn sẽ không lưu lại được dữ liệu sau khi nhận dạng chữ vì nút save đã bị bỏ đi. Nhưng vẫn còn một các khác là các bạn copy từng trang bằng cách bôi đen nguyên trang đó (chọn) sau đó copy và paste vào một cái chương trình sử lý text nào đó (thí dụ như MS word)
Vì phải copy từng trang nên sẽ lâu ( tất nhiên là không thể nhanh bằng bấm nút save nguyên cả mấy chục trang một lúc rùi) nên sẽ đòi hỏi sự kiên nhẫn của các bạn
nhưng đang trong lúc làm tiên "khồng" (túi không tiền) thì cũng đành mỉn cười mà bằng lòng vậy.
Sau đây là một số kinh nghiệm mà tui đã trải qua (để đưa một số tác phẩm lên thư viện như: 2 số phận, bố già, thủy hử, những người khốn khổ, đất rừng phương nam....) mời các bạn tham khảo.
1- sách truyện đem scan phải là loại sách rõ ràng, giấy trắng mực đen (những truyện giấy đen xì xuất bản những năm đói kém, hoặc truyện kiếm hiệp của nhà xuất bản quảng ngãi thì có thể quên đi ) nếu cố gắng nhận dạng thì cũng sửa chính tả chết luôn
2- ký tự phải có chân (thí dụ như font time new romans ) những ký tự không có chân (như Arial) cũng được nhưng với điều kiện phải rõ ràng (mà cũng phải sửa chính tả nhiều lắm)
3- VNDOC có thể "học" được, trong một tác phẩm sau khi scan sẽ có nhiều lỗi giống nhau, các bạn có thể cho nó học để biết những lỗi đó và lần sau sẽ không tái phạm nữa, (nhưng cũng chỉ được khoảng 80% thui) và sau đó nhớ lại thành một bản ghi nhớ riêng để lần sau scan tiếp tác phẩm đó thì đem ra sử dụng lại
4- sau khi copy ra word rùi các bạn phải làm những động tác sau:
-Canh dòng (vì các hàng text xuống dòng đúng như trong sách vậy )
-sửa lỗi chính tả (cái này các bạn phải tạo một Marco để đỡ phải lặp đi lặp lại)
Đó ! để làm ra được một bản text từ khi scan cho đến khi hoàn tất không hề dơn giản như suy nghĩ rằng cứ đưa vô scan rồi nhận dạng là xong, cái này để các bạn đã từng đánh máy rùi làm thử xem coi cái nào nhanh hơn và tiện lợi hơn sẽ dễ dàng so sánh.
các bạn có thể lấy bản DEMO xuống ở đây :
VNDOC20DEMO
Chúc các bạn tìm thấy cái mình cần tìm
Ý qwên ! khi scan các bạn phải chỉnh độ sáng tối của mỗi lần scan sao cho đến khi nào đó nó có thể nhận dạng được hoàn thiện nhất (sáng quá thì mất nét, mà tối qua thì nét dính chùm vô nhau)
Mình là người tâm huyết với việc đưa tác phẩm từ trang giấy lên mạng từ rất lâu nên cũng để công tìm tòi xem có công cụ nào có thể chuyển được chữ việt từ dạng ảnh image sang dạng text không !
Vài năm trước mình đã thử sử dụng các chương trình nhận dạng ký tự của nước ngoài để thử nhận dạng ký tự việt, nhưng tất nhiên là không được vì các chương trình này không nhận biết được các dấu của tiếng việt, rồi mình cũng biết tới chương trình VNDOC từ khoảng 2 năm trước đây, tất nhiên là mình chỉ biết tới bản Demo của nó thui.
Phải công nhận là tuyệt vời, khi đang cố công tìm mà kiếm được thì sướng đến độ nào không nói thì các bạn cũng biết
![[:D]](/images/smiley/s2.gif)
Trong khi chưa mua được bản nghiêm chỉnh ( còn chờ các bạn kêu gọi đóng góp) thì các bạn có thể thử trước bằng bản DEMO của VNDOC bản 2.0
với bản DEMO này các bạn sẽ không lưu lại được dữ liệu sau khi nhận dạng chữ vì nút save đã bị bỏ đi. Nhưng vẫn còn một các khác là các bạn copy từng trang bằng cách bôi đen nguyên trang đó (chọn) sau đó copy và paste vào một cái chương trình sử lý text nào đó (thí dụ như MS word) Vì phải copy từng trang nên sẽ lâu ( tất nhiên là không thể nhanh bằng bấm nút save nguyên cả mấy chục trang một lúc rùi) nên sẽ đòi hỏi sự kiên nhẫn của các bạn
nhưng đang trong lúc làm tiên "khồng" (túi không tiền) thì cũng đành mỉn cười mà bằng lòng vậy.Sau đây là một số kinh nghiệm mà tui đã trải qua (để đưa một số tác phẩm lên thư viện như: 2 số phận, bố già, thủy hử, những người khốn khổ, đất rừng phương nam....) mời các bạn tham khảo.
1- sách truyện đem scan phải là loại sách rõ ràng, giấy trắng mực đen (những truyện giấy đen xì xuất bản những năm đói kém, hoặc truyện kiếm hiệp của nhà xuất bản quảng ngãi thì có thể quên đi ) nếu cố gắng nhận dạng thì cũng sửa chính tả chết luôn
2- ký tự phải có chân (thí dụ như font time new romans ) những ký tự không có chân (như Arial) cũng được nhưng với điều kiện phải rõ ràng (mà cũng phải sửa chính tả nhiều lắm)
3- VNDOC có thể "học" được, trong một tác phẩm sau khi scan sẽ có nhiều lỗi giống nhau, các bạn có thể cho nó học để biết những lỗi đó và lần sau sẽ không tái phạm nữa, (nhưng cũng chỉ được khoảng 80% thui) và sau đó nhớ lại thành một bản ghi nhớ riêng để lần sau scan tiếp tác phẩm đó thì đem ra sử dụng lại
4- sau khi copy ra word rùi các bạn phải làm những động tác sau:
-Canh dòng (vì các hàng text xuống dòng đúng như trong sách vậy )
-sửa lỗi chính tả (cái này các bạn phải tạo một Marco để đỡ phải lặp đi lặp lại)
Đó ! để làm ra được một bản text từ khi scan cho đến khi hoàn tất không hề dơn giản như suy nghĩ rằng cứ đưa vô scan rồi nhận dạng là xong, cái này để các bạn đã từng đánh máy rùi làm thử xem coi cái nào nhanh hơn và tiện lợi hơn sẽ dễ dàng so sánh.
các bạn có thể lấy bản DEMO xuống ở đây :
VNDOC20DEMO
Chúc các bạn tìm thấy cái mình cần tìm
Ý qwên ! khi scan các bạn phải chỉnh độ sáng tối của mỗi lần scan sao cho đến khi nào đó nó có thể nhận dạng được hoàn thiện nhất (sáng quá thì mất nét, mà tối qua thì nét dính chùm vô nhau)
Vui sống cuộc đời giản dị !