天择网
项目目录/词库转 JSON
词库整理技能 · TXT · CSV · XLSX · DOCX · PDF · MARKDOWN

把零散词表整理成可以直接学习的标准词库

它会识别单词、词性、音标、多个释义、例句和标签,合并重复项并保留特殊字符,最后生成天择背单词可以导入的 JSON。

多格式输入一词多义自动去重导入前校验

先把源文件整理到“人能看懂”

格式不必统一,但每条记录至少要能辨认出单词。表格最好一行一个词;纯文本可一行一个词,也可以用制表符分隔单词、词性和释义。

格式推荐结构注意
TXT / Markdown每行一个词,后跟释义或列表避免把整篇文章当词表
CSV / Excel单词、词性、释义、音标、例句分列第一行保留清晰表头
Word表格或规则列表批注和修订先处理
PDF可选中文字的词表扫描件需先做文字识别并人工抽查

如果同一列混有音标、页码和释义,先说明识别规则。难以判断的内容应保留原文并标记待确认,不要让 AI 猜成确定结果。

使用步骤:在 Codex 中开始转换

  1. 上传或指定词库文件。
  2. 说明目标是“天择背单词标准 JSON”。
  3. 指出已有列的含义、需要保留的标签和是否允许补充释义。
  4. 要求先生成校验报告,再输出最终 JSON。
  5. 抽查报告后,把最终文件导入词汇训练。
把这份 Excel 词库转换成天择背单词标准 JSON。A 列是单词,B 列是词性,C 列可能包含多个中文释义,D 列是例句。保留原内容,不确定的字段留空;先报告重复项和异常行,再输出文件。

只有单词、没有释义时,可以明确要求 AI 补写;如果已有释义,则默认以原词库为准,不应悄悄重写。

输出结构与标准 JSON 字段

[ { "word": "accommodate", "phonetic": "/əˈkɒmədeɪt/", "pos": "v.", "meaning": ["容纳;提供空间", "迁就;照顾", "适应"], "examples": [{ "en": "The hall can accommodate 500 people.", "zh": "大厅可容纳五百人。" }], "tags": ["CET-6"] } ]
字段类型规则
word字符串必填,去除首尾空格,保留连字符和撇号
phonetic字符串可空,保留音标符号原样
pos字符串可空,同一词多词性可按来源合并
meaning字符串数组每个释义独立,不把数组写成一整段
examples对象数组英文和中文分别放入 en、zh
tags字符串数组考试、章节或自定义分类

重复项如何合并

单词比较时忽略首尾空格和普通大小写,但不随意删除连字符或撇号。相同单词的非空字段合并,释义、例句和标签按内容去重,并保留首次出现顺序。

  • 同一拼写但词性不同:保留所有词性和各自释义。
  • 大小写承载专名含义:保留原写法并标记人工确认。
  • 释义近似但不完全相同:不要仅凭相似度删除。
  • 音标冲突:保留来源或列入异常报告。
  • 空记录、页眉、页码和纯标点行:排除并计数。

导入前必须检查

  1. JSON 能正常解析,顶层是数组,每项都是对象。
  2. 每项都有非空 word,meaning、examples 和 tags 类型正确。
  3. 没有“undefined”“null”字符串、乱码或被替换的音标字符。
  4. 总记录数与“源记录-排除项-合并项”能够对上。
  5. 随机抽查开头、中间、结尾以及所有异常行。
  6. 用天择背单词试导入一小份,再导入完整词库。
校验报告应写清:源记录数、输出记录数、重复组、排除行、缺少释义和冲突字段。只有“转换成功”四个字不够。

导入并开始四流程学习

  1. 打开天择背单词,进入词库管理。
  2. 选择“导入 JSON”,选中转换后的文件。
  3. 查看导入预览,确认新增、合并、跳过和错误数量。
  4. 确认后建立学习批次,按英译中预习、中译英回忆、拼写和语境四个流程学习。

如果只是临时试用,先导入三到五十个词。确认释义显示、例句和标签都正确后,再导入整本词库。

常见问题

PDF 只提取出乱码

它可能是扫描图片或使用特殊字体。先做文字识别,再与页面截图抽查;无法可靠识别的页不要自动补猜。

Excel 多个工作表混在一起

明确需要哪些工作表,并给每张表设置来源标签。表头不同的工作表先各自映射,再合并。

导入时提示字段错误

确认顶层不是对象包装,释义和标签是数组,例句是含 en、zh 的对象数组,并移除尾随逗号。

重复词没有合并

检查不可见空格、全角字符、连字符变体和大小写。规范化只用于比较,最终显示仍应保留正确拼写。

隐私、版权和词库维护

转换私人笔记或付费教材词表时,不要公开原文件和完整转换结果。输出前删除姓名、学号、批注和其它个人信息;分享给别人前确认你有权分发内容。

以后补充单词时,继续使用同一字段结构,并保留一份未合并的源词库和转换报告。这样出现误合并或释义问题时,能够回到具体来源修正,而不是在最终 JSON 里反复手工改。