Viettel OCR - lời giải cho "tự động hoá" dữ liệu

VIETTEL OCR - LỜI GIẢI CHO "TỰ ĐỘNG HOÁ" DỮ LIỆU

Câu chuyện về OCR và sức mạnh ngầm của một công nghệ xử lý "big data".

Viettel OCR - lời giải cho "tự động hoá" dữ liệu

Câu chuyện về OCR và sức mạnh ngầm của một công nghệ xử lý "big data".

Trong thế giới số có một thuật ngữ gọi là "Dark data" - "Dark data" là dữ liệu không có cấu trúc, chưa thể sử dụng được nếu không qua xử lý, phân tích, sắp xếp. Nếu data tăng lên với cấp số nhân thì trong đó phần được cho là "dark data" tăng lên theo cấp số mũ. Điều này đòi hỏi con người phải sẵn sàng các giải pháp xử lý dữ liệu lớn và siêu lớn. Vai trò của dữ liệu là đặc biệt quan trọng, nhưng việc khai thác, tối ưu dữ liệu trở thành tài sản có giá trị lại không hề đơn giản.

Trong khoảng 3 năm gần đây, giải pháp số hóa văn bản OCR trở nên hấp dẫn với nhiều doanh nghiệp bởi sức mạnh xử lý dữ liệu của nó. Nhưng ít ai biết, từ những năm đầu của thế kỷ XX, nhà vật lý Emanuel Goldberg đã phát triển một máy đọc các ký tự và chuyển đổi chúng thành mã điện báo tiêu chuẩn được gọi là "máy tính thống kê" để tìm kiếm số lưu trữ trong vi phim (microfilm) bằng cách sử dụng một hệ thống nhận diện mã quang học.

Năm 1931, ông được cấp bằng sáng chế của Hoa Kỳ số 1,838,389 cho phát minh của mình và sau đó đã được mua lại bởi IBM. Cùng thời, Edmund Fournier d'Albe đã phát triển Optophone, một máy quét cầm tay khi di chuyển trên một trang in, tạo ra các âm tương ứng với các chữ cái hoặc ký tự cụ thể.

Đây chính là nền móng đầu tiên của việc tự động hóa lưu trữ hồ sơ, mang "dữ liệu tối" ra ánh sáng bằng cách tạo ra các dữ liệu có cấu trúc (bảng SQL) từ thông tin phi cấu trúc (văn bản, bảng biểu, hình ảnh...) và tích hợp dữ liệu đó với cơ sở dữ liệu có cấu trúc hiện có. IBM đã nhanh chóng mua lại bằng sáng chế của Emanuel và tiếp tục nghiên cứu, phát triển. Cho đến năm 2002, việc có thể sử dụng OCR ngay trên điện thoại di động và máy tính để bàn thông qua điện toán đám mây được coi là một bước ngoặt.

Tại Việt Nam, mặc dù OCR được tiếp cận sau nhưng đến nay đã đạt được những kết quả tương đương với thế giới trong việc xử lý ngôn ngữ tiếng Việt (các công ty công nghệ lớn trên thế giới thường tập trung xử lý ngôn ngữ tiếng Anh).

Năm 2020, theo quy định của Thông tư 23/2019/TT-NHNN, các dịch vụ ví điện tử, thanh toán trung gian phải xác thực tài khoản người dùng qua CMND, hay các quy định liên quan đến mở tài khoản của Ngân hàng Nhà nước là động lực thúc đẩy doanh nghiệp nhanh chóng ứng dụng OCR để trích xuất thông tin, tự động hóa quá trình nhập liệu và xét duyệt thông tin. Trước nhu cầu lớn, thị trường mở rộng, chính sách của nhà nước thúc đẩy chuyển đổi số là động lực để Trung tâm không gian mạng Viettel đã tập trung nghiên cứu, đóng gói bộ giải pháp OCR trên cơ sở kết hợp các công nghệ:

- Công nghệ nhận dạng ký tự quang học (OCR) cho phép nhận dạng tài liệu dạng PDF, dạng ảnh, văn bản giấy…;

- Công nghệ xử lý ngôn ngữ tự nhiên (NLP) tự động hiệu chỉnh thông tin đảm bảo độ chính xác cao về mặt ngữ nghĩa

Sức mạnh của Viettel OCR còn đến từ công nghệ học sâu (Deep Learning) đem lại kết quả nhận dạng trên 99% đối với chữ in, trên 90% đối với chữ viết tay và lên tới 98% đối với việc trích xuất thông tin theo trường, vượt trội so với các nhà phát triển cùng lĩnh vực trên thị trường từ 4-5%.

Các tin tức khác