AI开放平台模型训练

GitHub——荀子古籍大语言模型开源项目

GitHub平台上的荀子系列大语言模型(原名荀子大模型),是专注于中华古籍文献处理的开源人工智能项目。该模型基于Qwen、ChatGLM3、Baichuan2等主流基座进行微调,拥有超过20亿字的...

标签:

产品简介

荀子系列大语言模型(XunziALLM)是一个托管于GitHub的开源项目,旨在利用先进的人工智能技术处理和分析中华古籍文献。该项目原名“荀子大模型”,由南京理工大学、南京师范大学及中国国家图书馆等机构的研究者合作支持。模型基于包含《四库全书》在内的绝大多数传世古籍文献构建,语料库规模超过20亿字。通过结合Qwen、ChatGLM3、Baichuan2等主流开源基座模型,荀子系列提供了针对古籍领域优化的基座模型和对话模型,致力于降低古籍数字化的技术门槛,提升研究效率。

核心功能

荀子模型针对古籍文本的特殊性,开发了多项专用功能:

  • 古籍智能标引:能够对古籍内容进行高质量的主题标引,帮助研究人员快速把握文章核心主题。
  • 信息抽取:自动从古籍中提取人物、事件、地点等关键实体及其关系,大幅减少人工整理数据的时间。
  • 自动标点与断句:解决古籍无标点带来的阅读障碍,快速完成文本断句和标点添加,提升阅读体验。
  • 高质量翻译:将晦涩难懂的古文翻译成现代汉语,辅助理解原文含义。
  • 词法分析:提供自动分词和词性标注服务,支持语言学层面的深入研究。
  • 诗歌生成:根据给定主题或关键词,生成符合语法和韵律要求的古诗,激发创作灵感。

模型架构与版本

荀子系列模型发布了多个版本,涵盖不同参数量级和基座架构,以满足多样化的算力需求和应用场景。主要发布的模型包括:

模型名称 类型 对应基座
Xunzi-Qwen-7B 基座模型 Qwen-7B (v1.0.5)
Xunzi-Qwen-7B-CHAT 对话模型 Qwen-7B
Xunzi-GLM-6B 基座模型 ChatGLM3-6B
Xunzi-Baichuan-7B 基座模型 Baichuan2-7B
Xunzi-Qwen1.5-4B/7B/14B 基座模型 Qwen1.5系列
Xunzi-Qwen1.5-7B_chat 对话模型 Qwen1.5-7B (推荐)
Xunzi-Qwen2-7B/1.5B 基座模型 Qwen2系列

用户可根据自身硬件条件和任务需求选择合适的模型版本。其中,Xunzi-Qwen1.5-7B_chat被推荐用于对话场景,并提供了免费的API调用服务。

使用方式与API调用

荀子模型支持本地部署和API调用两种方式。对于非人工智能领域的用户,项目提供了与调用千问、Baichuan2、ChatGLM3等模型一致的方法。特别是Xunzi-Qwen1.5-7B_chat模型,支持通过OpenAI兼容的Python库直接调用。

以下是使用OpenAI库调用对话模型的示例代码结构:

  • 设置API Key为任意值(如”ANY THING”)。
  • 配置Base URL为项目提供的服务端点。
  • 构建包含system和user角色的消息列表。
  • 发送请求并获取模型生成的回复内容。

这种兼容性使得开发者可以无缝集成现有的大模型应用框架,快速实现古籍问答、信息抽取等功能。

适用人群与场景

荀子大模型广泛适用于以下群体和场景:

  • 文史研究人员:利用信息抽取和智能标引功能,快速梳理海量古籍文献,构建知识图谱。
  • 高校师生:作为教学辅助工具,通过自动翻译和标点功能,降低古文学习难度。
  • 开发者:基于开源基座模型进行微调,开发垂直领域的古籍处理应用。
  • 传统文化爱好者:使用诗歌生成和阅读理解功能,探索古典文学的魅力。

使用建议与注意事项

在使用荀子系列模型时,建议用户注意以下几点:

  • 微调优化:由于发布了基座模型,用户可根据特定下游任务的需求,使用本地训练语料对模型进行微调,以获得更佳的性能表现。
  • 合规使用:依据《生成式人工智能服务管理暂行办法》,用户应确保训练和使用过程符合相关法律法规,避免生成违法不良信息。
  • 风险提示:大语言模型存在随机性,可能产生幻觉或错误信息。在学术引用或重要决策中,务必对模型输出进行人工核验。项目方不对因模型误导、滥用导致的数据安全或舆论风险承担责任。

常见问题

如何调用荀子模型的对话功能?

用户可以通过OpenAI兼容的Python库调用Xunzi-Qwen1.5-7B_chat模型。只需将API Base URL设置为项目提供的地址,并使用任意API Key即可发起聊天请求。这种方式无需复杂的本地环境配置,适合快速体验和多轮对话测试。

荀子模型支持哪些基座架构?

荀子系列模型支持多种主流开源基座,包括阿里通义千问(Qwen/Qwen1.5/Qwen2)、智谱AI的ChatGLM3以及百川智能的Baichuan2。不同基座的模型在调用方式上与其原生模型保持一致,方便熟悉这些生态的开发者直接使用。

模型输出的准确性如何保证?

虽然荀子模型在古籍处理任务上表现良好,但大模型固有的随机性可能导致输出偏差。项目方建议在关键应用中结合人工审核。此外,用户可以通过微调基座模型,引入更高质量的特定领域数据,从而提升模型在特定任务上的准确性和稳定性。

数据统计

相关导航