去年帮公司报首款AI商品图生成系统的软著,我光架构说明就被打回了两次,第一次是把开源框架的内容写得太多,自研部分的描述连半页都不到,审查员直接打回说无法界定原创权属;第二次是漏写了AI生成内容的合规校验模块,刚好赶上那段时间对AI类软件的审查收紧,又补了快一周的材料才过。前前后后折腾了快一个月,后来摸清楚门道,这两年帮团队报的5套不同方向的AI生成系统软著,都是一次过审。
很多人觉得AI生成系统的架构说明和普通软件没区别,随便套个三层架构的模板就往上填,其实完全不是这么回事。AI生成系统的核心逻辑涉及训练、推理两个完全独立的链路,还有大量和开源模型、开源框架交互的部分,审查员要明确看到你自主开发的部分和开源组件的边界,才会认定你的软著权属有效。
我一般写架构说明的时候,开头先写200字左右的系统定位,别一上来就堆技术名词,比如你做的是面向新媒体从业者的AI文案生成系统,就写清楚“本系统主要服务于图文创作者的短视频脚本、公众号文案生成场景,核心解决创作者选题难、产出效率低的问题,整体自研模块占比超过75%”,先给审查员一个清晰的认知,知道你这个系统是解决什么具体问题的。
接下来写整体架构的分层,我习惯分成数据层、模型训练层、推理服务层、应用交互层四个部分,每个部分都要明确标注自研内容和开源组件的边界。比如数据层,别就写一句“采用公开数据集训练”,要写清楚你自己做的工作:“数据层包含公开数据集、自研垂直领域标注数据集两部分,其中自研数据集覆盖12个新媒体文案赛道共120万条标注内容,自主开发了数据去重、敏感内容清洗的规则算法,过滤无效数据超过30万条”,这些都是你实实在在的原创工作,写得越细,说服力越强。之前帮朋友看他们的申报材料,就看到有人把数据层全写的是公开数据集,自己半毛钱工作都没提,被打回一点都不冤。做AI生成系统软著申报的时候,最忌讳的就是把自己的工作藏着掖着,全写通用技术,审查员根本没办法判断你有没有真的做开发。
核心模块的说明要分开训练侧和推理侧来写,这部分是AI生成系统和普通软件最大的区别。训练侧要写清楚你做的模型微调策略、损失函数的优化点,还有你针对特定场景做的模型适配,比如“训练侧基于开源Llama2-7B模型做二次微调,自主开发了多轮上下文记忆模块,能够识别用户前3次生成请求的偏好,生成内容的匹配度提升了42%”,明确写清楚底座是开源的,你做的创新点是什么,边界划得越清,审查员越放心。推理侧要写清楚你做的低延迟优化、参数映射逻辑这些内容,比如用户在前端选了“搞笑风格、15秒短视频脚本”,你怎么把这些用户输入的参数转换成模型能识别的prompt,有没有自研的prompt词库,有没有做并发请求的算力调度,这些都是非常好的原创证明点。还有现在必写的合规校验模块,一定要专门列一段写清楚你怎么过滤涉政、涉黄、侵权的生成内容,这是最近两年AI类软著审查的必查项,漏写的话大概率要补材料。
我之前踩过的最大的坑,就是架构说明的内容和提交的源代码对应不上。那次我瞎写了一个“用户个性化模型存储模块”,结果源代码目录里根本没有对应的文件,审查员要求我补这个模块的代码片段和说明,我折腾了快两周才把材料补完。后来我整理材料的时候,都会先用软著Pro过一遍架构说明的内容,它会自动把你架构里提到的模块和你提交的源代码目录做匹配,要是有提到但没对应代码的模块会直接标红提醒,帮我筛掉了好几个低级错误,省得我再跑版权局补材料。
架构说明的最后,别只甩一张架构图就完事,要配一段完整的调用流程的文字说明,比如“用户在前端提交生成请求后,首先经过请求校验模块判断用户权限和请求参数合法性,之后调用参数解析模块将用户的自然语言参数转换为模型可识别的prompt,再通过算力调度模块分配空闲GPU资源调用推理引擎生成内容,生成的内容经过自研的合规校验模块过滤敏感内容后,最终返回给前端展示”,整个流程顺下来,审查员一眼就能看明白你这个系统的运行逻辑,还有哪些模块是你自己做的。
很多人不知道AI生成系统架构说明的撰写尺度,怕写得太细泄露商业机密,其实完全不用担心,你只要把模块的功能、逻辑、和开源部分的边界写清楚就行,不用贴具体的代码或者核心参数。要是实在拿不准哪些该写哪些不该写,可以找之前申报过的模板对照着看,或者用工具先做个预审核,只要逻辑通顺、原创点明确、和源代码能对应上,基本上都能一次过审。我上个月帮一个创业团队报他们的AI短视频生成系统的软著,就是按照这个逻辑写的,7天就拿到了受理通知书,比我第一次申报快了不知道多少。