[비즈한국] 在公共机构构建AI学习用数据项目的过程中,一项具有里程碑意义的版权侵权判决出炉。因著作物被擅自用于国立国语院“大众语料库(Everyone's Corpus)”项目,著作权人向承包商熊津及Woongjin Bookshen提起的损害赔偿诉讼,在一审和二审中均胜诉。
法院判定,拥有出版及发行电子书的权利,并不代表拥有将其复制、加工为AI学习数据的权利。对此,舆论评价称,该判决再次确认了即使是出于公共目的的数据构建项目,未经著作权人许可也不得使用其著作物,且仅凭“合理使用(Fair Use)”原则难以将其行为正当化。

版权争议尘埃落定,赔偿责任获认定
首尔中央地方法院民事第8-3庭于上月24日,在出版商“Communication Books”出版书籍的78名著作权人向熊津及Woongjin Bookshen提起的损害赔偿诉讼二审中,判决原告部分胜诉。法院裁定,在原告请求的总额约550万韩元中,赔偿约344万韩元。此前,去年2月的一审判决原告部分胜诉,熊津随后提出上诉,但二审维持了原判。
此次诉讼始于2022年9月爆发的“国立国语院语料库事件”。当时,熊津与国立国语院签署了价值30.6亿韩元的“文言语料库原文资料收集项目”服务合同。此后,熊津将价值约17.38亿韩元的著作物提供及整理服务外包给子公司Woongjin Bookshen。Woongjin Bookshen则基于其在2010年收购的电子书公司“Booktopia”的资源,负责构建并交付原文资料。
语料库(corpus)是为方便计算机分析而建立的书籍、新闻报道、对话等语言数据库。国立国语院为进行国语研究及辞书编纂等目的推动了该项目,近期也被用作生成式AI及大语言模型(LLM)的核心学习数据。

语料库事件因出版界的集体反弹而浮出水面。当时出版界主张,约1.6万种电子书在未经著作权人允许的情况下被用于该项目,构成了版权侵权。虽然大韩出版文化协会、国立国语院及Woongjin Bookshen随后签署了相关协议,但本次诉讼是当时协议之外,由个别著作权人提起的损害赔偿案件。
“AI数据构建也适用版权原则”…驳回合理使用主张
二审法院驳回了熊津方面关于“全面权利继承”的主张,认为难以认定Woongjin Bookshen从Booktopia获得了关于著作物复制及公众传送的全面权利。法院意在表明,出版社与作者签订的合同通常仅限于出版原著或提供电子书的权利,很难将其视为包含为了提供独立产品而进行的复制、加工权利。
针对合理使用的主张,法院也判断称:“仅凭被告主张的情况,难以认为对涉案著作物的使用属于著作权法下的合理使用。”

虽然国立国语院的语料库项目确实是出于公共利益目的,但法院给出的判决依据包括:熊津执行的服务合同具有营利目的;合同中明确规定“应与著作权人确认权利并签订使用许可协议,且需将服务费的80%以上用于支付著作权处理费用”,但其却在未获得原告使用许可的情况下擅自加工了著作物等。
赔偿金额的计算方式为:电子书标价的70%乘以印数5本,再乘以每部著作物的原稿持股比例。
此次判决确认了常规版权原则同样适用于公共机构推动的AI及语言数据构建项目。法院还指出,随着AI开发对数据库构建需求的增加,著作物使用许可市场已经形成。这意味着,仅凭AI开发这一公共利益目的,难以限制著作权人的正当利益。
在语料库事件后,大韩出版文化协会、国立国语院及Woongjin Bookshen曾在2023年签署了协议,核心内容包括缩短著作物使用期限、支付追加使用费以及成立运营委员会等。根据协议,双方对制度进行了修订,包括缩短著作物使用期限,后续使用则遵循出版社的选择及另行签订合同的原则。
由于熊津决定不再上诉,预计此次诉讼将以二审判决告终。熊津相关人士表示:“尊重法院的判断,没有上诉计划。”