AI mở cánh cửa tiếp cận di sản Hán Nôm sau hơn 1.000 năm

5 시간 전 15

AI mở cánh cửa tiếp cận di sản Hán Nôm sau hơn 1.000 năm - Ảnh 1.

PGS.TS Đinh Điền, Giám đốc Trung tâm Ngôn ngữ học Tính toán - Trường ĐH Khoa học tự nhiên, ĐH Quốc gia TP.HCM - Ảnh: H.N.

Đề tài "Nghiên cứu xây dựng hệ thống dịch tự động Hán Nôm sang chữ Quốc ngữ giai đoạn 2" (của PGS.TS Đinh Điền, Giám đốc Trung tâm Ngôn ngữ học Tính toán - Trường ĐH Khoa học tự nhiên, ĐH Quốc gia TP.HCM và các cộng sự) vừa được Hội đồng tư vấn nghiệm thu của Sở Khoa học và Công nghệ TP.HCM đánh giá hoàn thành xuất sắc. Công trình giúp mở rộng khả năng tiếp cận kho tri thức Hán Nôm không chỉ cho giới nghiên cứu mà cả cộng đồng.

Khám phá kho tàng di sản Hán Nôm

Trao đổi với Báo điện tử Tuổi Trẻ, PGS.TS Đinh Điền cho biết chữ Nôm được người Việt sáng tạo từ khoảng thế kỷ X dựa trên chữ Hán và được sử dụng suốt hơn một thiên niên kỷ. 

Kho tàng văn học, lịch sử, địa lý, y học dân tộc và nhiều lĩnh vực khác đều được ghi chép bằng hệ thống văn tự này. 

Tuy nhiên, hiện nay rất ít người còn có thể đọc hiểu Hán Nôm, trong khi các hệ thống AI phổ biến trên thế giới như ChatGPT, Gemini hay DeepSeek chỉ xử lý được chữ Hán hiện đại, chưa thể hiểu được chữ Nôm.

Theo thống kê của Hội Bảo tồn di sản Hán Nôm, hơn 90% tư liệu Hán Nôm hiện nay chưa được dịch sang chữ Quốc ngữ. 

Hàng triệu trang sắc phong, châu bản, gia phả, địa bạ, văn bia, thư tịch cổ, hoành phi, câu đối hay các bài thuốc dân gian vẫn chủ yếu tồn tại dưới dạng ảnh hoặc bản số hóa, trong khi số người có khả năng đọc hiểu Hán Nôm ngày càng ít.

"Vì vậy, nếu không sớm ứng dụng công nghệ để nhận dạng và chuyển đổi các văn bản cổ, nhiều tư liệu quý sẽ bị mai một bởi thời gian.

Mục tiêu của chúng tôi là xây dựng một hệ thống có thể giúp mọi người tiếp cận, tra cứu và hiểu được nội dung các văn bản Hán Nôm một cách thuận tiện, miễn phí. 

Ở giai đoạn 1, nhóm nghiên cứu chỉ xử lý được văn bản dạng chữ, giai đoạn 2 đã có thể nhận dạng các văn bản dưới dạng ảnh - vốn chiếm gần như toàn bộ nguồn tư liệu Hán Nôm hiện nay.

Điểm đột phá của giai đoạn 2 là giải quyết bài toán nhận dạng ký tự quang học (OCR) cho tài liệu Hán Nôm" - PGS.TS Đinh Điền thông tin.

Và thành quả

Trên nền tảng dữ liệu và các mô hình AI được xây dựng, nhóm nghiên cứu do PGS.TS Đinh Điền dẫn dắt đã phát triển hệ sinh thái Kim Hán Nôm, hoạt động trên nền tảng web, Android và iOS. 

Hệ thống không chỉ nhận dạng, chuyển tự và hỗ trợ dịch văn bản Hán Nôm mà còn cung cấp các giao diện kết nối (API), cho phép các cơ quan, doanh nghiệp, cá nhân tích hợp những tính năng này vào các ứng dụng khác. 

Đối với các hình ảnh ngoại cảnh như hoành phi, câu đối tại đền chùa hay di tích, hệ thống còn có khả năng hiển thị trực tiếp phần chữ Quốc ngữ trên nền ảnh gốc, giúp người dùng dễ dàng đối chiếu nội dung.

Theo PGS.TS. Đinh Điền, độ chính xác của hệ thống phụ thuộc vào chất lượng dữ liệu đầu vào. 

Với văn bản dạng chữ thuộc các lĩnh vực phổ biến như văn học, lịch sử hay địa lý, độ chính xác của phần chuyển tự đạt trên 99%. 

Những trường hợp văn bia quá mờ, chữ viết tay hoặc các kiểu chữ đặc biệt vẫn cần đến kinh nghiệm và tri thức của các chuyên gia Hán Nôm để hiệu đính.

"Không chỉ phục vụ giới nghiên cứu, hệ thống còn hướng đến cộng đồng. Người dân có thể sử dụng điện thoại để chụp ảnh hoành phi, câu đối, sắc phong, gia phả, khế ước hay các văn bản cổ do gia đình lưu giữ, sau đó để hệ thống tự động nhận dạng và chuyển sang chữ Quốc ngữ. Nhờ đó, những tư liệu vốn khó tiếp cận có thể được hiểu và khai thác dễ dàng hơn" - PGS.TS Đinh Điền chia sẻ.

Ngoài ra, nhóm nghiên cứu còn xây dựng kho dữ liệu Hán Nôm lớn nhất từ trước đến nay tại Việt Nam với 200.000 ảnh trang văn bản Hán Nôm, 200.000 ảnh được gán nhãn phục vụ huấn luyện OCR, 750.000 cặp câu song ngữ Hán Nôm - Quốc ngữ và hơn 1 triệu câu đơn ngữ Hán Nôm, tương đương khoảng 16 triệu ký tự.

"Hầu hết dữ liệu ban đầu đều ở dạng thô nên nhóm phải xây dựng quy trình chuẩn hóa, gán nhãn và kiểm tra chéo bằng cả AI lẫn chuyên gia để đảm bảo chất lượng dữ liệu huấn luyện" - nhóm nghiên cứu cho biết.

Tại buổi nghiệm thu đề tài, các chuyên gia kỳ vọng hệ thống sẽ trở thành công cụ hỗ trợ hiệu quả cho các trường đại học, thư viện, bảo tàng, trung tâm lưu trữ và các đơn vị bảo tồn di sản trong việc nhận dạng, phân loại, tra cứu và tóm tắt tư liệu Hán Nôm. 

Xa hơn, công nghệ này còn có thể mở ra nhiều hướng nghiên cứu mới trong các lĩnh vực như lịch sử, địa lý, y học cổ truyền, chủ quyền biển đảo,...

Hành trình hơn 20 năm đưa AI đến với di sản Hán Nôm

Ít ai biết ý tưởng về công trình này đã được PGS.TS Đinh Điền ấp ủ từ hơn hai thập niên trước. Khi tham gia biên soạn và phát triển các bộ từ điển Anh - Việt, Việt - Anh trên Kim Từ Điển - một trong những từ điển điện tử tiên phong của Việt Nam, ông đã nghĩ đến việc ứng dụng trí tuệ nhân tạo để "đọc" và dịch tư liệu Hán Nôm sang chữ Quốc ngữ.

"Kho tàng Hán Nôm lưu giữ lịch sử, văn hóa và tri thức của dân tộc qua hàng nghìn năm, nhưng phần lớn vẫn nằm ngoài khả năng tiếp cận của số đông", PGS.TS Đinh Điền chia sẻ. 

Chính trăn trở đó đã trở thành động lực để ông và các cộng sự theo đuổi đề tài trong suốt nhiều năm.

Tuy nhiên, do hạn chế về dữ liệu, sự phát triển của công nghệ AI ở từng giai đoạn, ý tưởng chỉ có thể từng bước hiện thực hóa và đến nay mới hoàn thành sau hơn 20 năm.

"Việc nhận dạng và chuyển tự mới chỉ là bước khởi đầu. Sau khi hoàn thành giai đoạn 2, nhóm nghiên cứu đang triển khai giai đoạn 3 với mục tiêu khó nhất: dịch nghĩa văn bản Hán. Để làm được điều này, AI không chỉ phải hiểu ngôn ngữ mà còn cần tích hợp tri thức về lịch sử, văn hóa, tôn giáo cùng nhiều lĩnh vực chuyên ngành khác. 

Song song đó, nhóm sẽ tiếp tục mở rộng kho dữ liệu theo từng lĩnh vực như lịch sử, tôn giáo, y học cổ truyền, văn bia và sắc phong để xây dựng các mô hình AI chuyên sâu" - PGS.TS Đinh Điền cho biết.

Bạn đọc có thể trải nghiệm hệ thống dịch tự động Hán Nôm sang chữ Quốc ngữ tại: https://tools.clc.hcmus.edu.vn/.

전체 기사 읽기