[비즈한국] Một phán quyết mang tính cột mốc về vi phạm bản quyền đã được đưa ra trong quá trình triển khai dự án xây dựng dữ liệu phục vụ học máy AI của các cơ quan công quyền. Các tác giả có tác phẩm bị sử dụng trái phép trong dự án ‘Kho ngữ liệu của mọi người’ (Everyone's Corpus) của Viện Ngôn ngữ Quốc gia Hàn Quốc đã thắng kiện cả hai cấp sơ thẩm và phúc thẩm trong vụ kiện đòi bồi thường thiệt hại nhắm vào nhà thầu là Woongjin và Woongjin Booksen.
Tòa án nhận định rằng việc sở hữu quyền xuất bản và phân phối sách điện tử không đồng nghĩa với việc được quyền sao chép và xử lý dữ liệu đó làm dữ liệu học máy AI. Phán quyết này được đánh giá là đã tái khẳng định nguyên tắc: ngay cả đối với các dự án xây dựng dữ liệu vì mục đích công, tác phẩm vẫn không thể được sử dụng khi chưa có sự cho phép của chủ sở hữu quyền tác giả, và khó có thể biện minh cho hành vi này chỉ dựa trên lập luận về ‘sử dụng hợp lý’ (fair use).

Chịu trách nhiệm bồi thường sau tranh cãi bản quyền
Vào ngày 24 tháng trước, Tòa án Trung tâm Seoul (Bộ phận dân sự 8-3) đã tuyên án chấp nhận một phần yêu cầu của nguyên đơn trong phiên tòa phúc thẩm vụ kiện đòi bồi thường thiệt hại do 78 tác giả của nhà xuất bản ‘Communication Books’ đệ trình chống lại Woongjin và Woongjin Booksen. Hội đồng xét xử đã chấp thuận mức bồi thường khoảng 3,44 triệu won trong tổng số khoảng 5,5 triệu won mà các nguyên đơn yêu cầu. Trước đó, vào tháng 2 năm ngoái, tòa sơ thẩm đã tuyên án có lợi cho các nguyên đơn, dù phía Woongjin đã kháng cáo nhưng tòa phúc thẩm vẫn giữ nguyên phán quyết của cấp sơ thẩm.
Vụ kiện này bắt nguồn từ ‘Sự cố kho ngữ liệu của Viện Ngôn ngữ Quốc gia’ nổ ra vào tháng 9 năm 2022. Thời điểm đó, Woongjin đã ký hợp đồng dịch vụ trị giá 3,06 tỷ won với Viện Ngôn ngữ Quốc gia để ‘thu thập dữ liệu văn bản ngôn ngữ viết’. Sau đó, Woongjin giao lại cho công ty con là Woongjin Booksen thực hiện việc cung cấp và phân loại tác phẩm với trị giá khoảng 1,738 tỷ won. Woongjin Booksen đã đảm nhận vai trò xây dựng và bàn giao dữ liệu gốc dựa trên nội dung từ ‘Booktopia’, một công ty sách điện tử mà họ đã mua lại vào năm 2010.
Kho ngữ liệu (corpus) là cơ sở dữ liệu ngôn ngữ được xây dựng từ sách, bài báo, văn bản đối thoại… để máy tính có thể phân tích. Viện Ngôn ngữ Quốc gia đã thúc đẩy dự án này nhằm phục vụ nghiên cứu ngôn ngữ và biên soạn từ điển, nhưng gần đây nó còn được sử dụng làm dữ liệu học tập cốt lõi cho các mô hình AI tạo sinh và mô hình ngôn ngữ lớn (LLM).

Sự cố kho ngữ liệu đã nổi lên thành vấn đề gây tranh cãi do sự phản đối tập thể từ giới xuất bản. Giới xuất bản cho rằng khoảng 16.000 loại sách điện tử đã bị sử dụng trong dự án mà không có sự cho phép của chủ sở hữu quyền tác giả, đồng thời khẳng định đó là vi phạm bản quyền. Mặc dù sau đó Hiệp hội Xuất bản Hàn Quốc, Viện Ngôn ngữ Quốc gia và Woongjin Booksen đã đạt được thỏa thuận liên quan, nhưng vụ kiện này là vụ việc riêng biệt do từng tác giả khởi kiện.
“Áp dụng nguyên tắc bản quyền ngay cả khi xây dựng dữ liệu AI”… Bác bỏ lập luận sử dụng hợp lý
Tòa phúc thẩm đã bác bỏ lập luận về ‘chuyển giao quyền toàn diện’ của phía Woongjin, cho rằng khó có thể coi Woongjin Booksen đã được chuyển giao toàn bộ quyền sao chép và truyền tải công cộng các tác phẩm từ Booktopia. Theo tinh thần của tòa, hợp đồng thông thường giữa nhà xuất bản và tác giả chỉ dừng lại ở quyền xuất bản nguyên tác hoặc cung cấp dưới dạng sách điện tử, khó có thể bao hàm cả quyền sao chép và xử lý để cung cấp như một sản phẩm riêng biệt.
Đối với lập luận về sử dụng hợp lý, tòa án cũng phán quyết rằng “chỉ dựa trên những tình tiết mà bị đơn đưa ra thì khó có thể coi việc sử dụng các tác phẩm trong vụ án là sử dụng hợp lý theo Luật Bản quyền”.

Mặc dù dự án kho ngữ liệu của Viện Ngôn ngữ Quốc gia được thực hiện vì mục đích công ích, nhưng các căn cứ được đưa ra bao gồm: hợp đồng dịch vụ mà Woongjin thực hiện mang tính chất lợi nhuận, và trong hợp đồng đã quy định rõ điều kiện ‘phải xác nhận quyền với tác giả, ký kết hợp đồng cho phép sử dụng và chi ít nhất 80% giá trị hợp đồng dịch vụ cho chi phí xử lý bản quyền’, thế nhưng họ đã xử lý các tác phẩm mà không có sự cho phép của các nguyên đơn.
Mức bồi thường thiệt hại được tính bằng cách lấy 70% giá bán lẻ của sách điện tử nhân với 5 bản in, rồi nhân với tỷ lệ sở hữu của tác giả đối với tác phẩm đó.
Phán quyết này khẳng định rằng các nguyên tắc bản quyền thông thường vẫn được áp dụng đối với cả các dự án xây dựng dữ liệu AI và ngôn ngữ do cơ quan công quyền thúc đẩy. Tòa án cũng chỉ ra rằng cùng với nhu cầu xây dựng cơ sở dữ liệu cho phát triển AI tăng cao, thị trường cấp phép sử dụng tác phẩm đã hình thành. Điều này làm rõ rằng không thể hạn chế quyền lợi hợp pháp của tác giả chỉ với mục đích công ích là phát triển AI.
Sau sự cố kho ngữ liệu, Hiệp hội Xuất bản Hàn Quốc, Viện Ngôn ngữ Quốc gia và Woongjin Booksen đã ký kết văn bản thỏa thuận vào năm 2023 với nội dung chính là rút ngắn thời hạn sử dụng tác phẩm, chi trả thêm phí sử dụng và thành lập ủy ban vận hành. Theo đó, hệ thống đã được sửa đổi để rút ngắn thời gian sử dụng tác phẩm và việc sử dụng sau đó sẽ tùy thuộc vào sự lựa chọn và hợp đồng riêng biệt của nhà xuất bản.
Vì Woongjin quyết định không kháng cáo lên cấp cao hơn, vụ kiện này được xem là kết thúc với phán quyết của tòa phúc thẩm. Một đại diện của Woongjin cho biết: “Chúng tôi tôn trọng phán quyết của tòa án và không có kế hoạch kháng cáo”.