AI时代更应该提前思考,构思自己的框架,让AI来补充

我在收集不同领域的数据,然后送检到AI检测平台的时候,之前的做法是收集一部分领域,然后送检一部分,总结报告。

做完了发现整个项目非常的乱,不同领域中表达的标签姐字段都不一致,由于在同一个项目中,很容易混淆,然后收集数据集的过程也是很缓慢,因为不同的数据集来源不一致,搜集最后的jsonl也是各种各样的格式。项目汇报的时候也不知道说啥

快做完了我发现可以做下面的事情让自己不那么乱。

我应该先构思需要哪些数据,什么样子的数据,最后送检前准备的数据需要多少,整理多少,不同的平台规则是否一致,数据是否可以通用等问题

比如,若是我将送检的数据提前维护一个 master数据。比如学术类,维护一个 academic_master_dataset.jsonl 文件,里面记录数据的元数据,不同平台的标签可以是 A_label、B_label、grouth_label,不应该用label来代替某个领域的标签,很容易混淆。

然后数据收集的时候我是单独起来的一个项目,我没有做完之前是每个领域的数据独立jsonl文件,每条记录的格式都不一致,导致最后送检分析的哪个文件夹中存在很多的解决格式的代码,应该是先约定好送检文件的格式,然后收集数据集的时候往这个格式靠。

做完整个项目,收集数据集的手段也很让我无奈,就是随着模型的能力的提升,理论上更加容易理解我们的提示词,但是由于我们要收集合法长度的文本,很容易忘记具体的方式,下面来整理下利用LLM改写文本的思路

  1. 直接少样本学习
  2. 单个简单提示词改写
  3. 提示词设置角色和角色背景进行改写
  4. 少样本学习生成简洁提示词,再根据这个提示词+少样本生成新的文本
  5. A模型用提示词AP改写完,再让B模型用另一个提示词进行改写
  6. 在单个提示词的基础上增加参数随机性,比如设置随机的温度、随机的模型等来提高改写文本多样性
  7. 商用大模型和非商用大模型的多次采样也可以扩大文本多样性,进而获得理想的文本
转载请注明出处