DeepFabric快速入门指南:5分钟掌握AI智能体训练数据生成

【免费下载链接】deepfabric Generate High-Quality Synthetics, Train, Measure, and Evaluate in a Single Pipeline 【免费下载链接】deepfabric 项目地址: https://gitcode.com/gh_mirrors/pr/deepfabric

在AI模型训练领域,高质量的训练数据是成功的关键。DeepFabric作为一款创新的AI智能体训练数据生成工具,为开发者提供了从数据生成到模型评估的一站式解决方案。无论你是AI新手还是经验丰富的开发者,这个快速入门指南将帮助你在5分钟内掌握DeepFabric的核心功能和使用方法。🎯

为什么选择DeepFabric?

DeepFabric与其他数据集生成工具的最大区别在于其独特的话题图生成算法,确保数据既多样化又领域相关。它通过真实的工具执行而非模拟来生成训练数据,让模型学会在实际环境中思考和行动。

DeepFabric数据生成流程 DeepFabric生成高质量AI训练数据的完整流程

快速安装与设置

1. 安装DeepFabric

使用pip一键安装DeepFabric:

pip install deepfabric

如果你计划使用训练或评估功能,建议安装完整版本:

pip install "deepfabric[training]"

2. 配置API密钥

根据你选择的LLM提供商设置相应的API密钥:

# OpenAI
export OPENAI_API_KEY="sk-..."

# Anthropic
export ANTHROPIC_API_KEY="sk-ant-..."

# Google Gemini
export GEMINI_API_KEY="..."

# 本地运行(无需API密钥)
curl -fsSL https://ollama.com/install.sh | sh
ollama pull mistral
ollama serve

3. 验证安装

运行以下命令确认安装成功:

deepfabric --help
deepfabric info

生成第一个数据集

现在让我们生成第一个AI训练数据集!🚀

export OPENAI_API_KEY="你的API密钥"

deepfabric generate \
  --topic-prompt "Python编程基础" \
  --generation-system-prompt "你是一位Python专家" \
  --mode graph \
  --depth 2 \
  --degree 2 \
  --num-samples 2 \
  --batch-size 1 \
  --provider openai \
  --model gpt-4o \
  --output-save-as 我的数据集.jsonl

发生了什么?

  1. 话题图生成:从"Python编程基础"开始,创建了一个深度为2、分支度为2的话题层次结构
  2. 数据集生成:为每个话题节点生成了训练样本
  3. 保存结果:所有样本保存到我的数据集.jsonl文件

使用配置文件进行高级配置

对于更复杂的项目,使用YAML配置文件可以更好地控制生成过程:

# config.yaml
topics:
  prompt: "机器学习基础"
  mode: graph
  depth: 2
  degree: 3

generation:
  system_prompt: "生成教育性的问答对。"
  conversation:
    type: basic
  llm:
    provider: openai
    model: gpt-4o

output:
  system_prompt: "你是一位有帮助的机器学习导师。"
  num_samples: 5
  batch_size: 1
  save_as: "机器学习数据集.jsonl"

运行配置文件:

deepfabric generate config.yaml

三种数据集类型

DeepFabric支持三种主要的数据集类型,满足不同的训练需求:

1. 基础数据集

简单的问答对,适用于通用指令跟随任务。配置文件中使用conversation.type: basic

2. 推理数据集

包含思维链痕迹,训练模型进行逐步问题解决。使用conversation.type: cotreasoning_style: freetext

3. 智能体数据集

包含真实工具调用的数据集,用于构建能够使用工具的AI智能体。这是DeepFabric最强大的功能之一!🤖

智能体数据集:真实工具执行

智能体数据集让模型学会在实际环境中使用工具。首先启动工具服务:

docker run -d -p 3000:3000 ghcr.io/always-further/deepfabric/tools-sdk:latest

然后配置智能体生成:

generation:
  conversation:
    type: cot
    reasoning_style: agent
  tools:
    spin_endpoint: "http://localhost:3000"
    components:
      builtin:
        - read_file
        - write_file
        - list_files
    max_per_query: 3
    max_agent_steps: 5

Python与Spin集成 DeepFabric与Spin框架集成,实现真实的工具执行环境

训练与评估流程

DeepFabric不仅生成数据,还支持完整的训练评估流程:

1. 加载和准备数据

from datasets import load_dataset

# 从Hugging Face加载
dataset = load_dataset("alwaysfurther/deepfabric-generic-tools", split="train")

# 分割训练集和评估集
splits = dataset.train_test_split(test_size=0.1, seed=42)
train_ds = splits["train"]
eval_ds = splits["test"]

2. 使用TRL或Unsloth训练

from trl import SFTTrainer, SFTConfig

trainer = SFTTrainer(
    model=model,
    tokenizer=tokenizer,
    train_dataset=formatted_train,
    args=SFTConfig(output_dir="./output", num_train_epochs=3),
)
trainer.train()

3. 评估模型性能

from deepfabric.evaluation import Evaluator, EvaluatorConfig

config = EvaluatorConfig(
    inference_config=InferenceConfig(
        model_path="./output/checkpoint-final",
        backend="transformers",
    ),
)

evaluator = Evaluator(config)
results = evaluator.evaluate(dataset=eval_ds)

print(f"工具选择准确率: {results.metrics.tool_selection_accuracy:.2%}")
print(f"参数准确率: {results.metrics.parameter_accuracy:.2%}")

最佳实践与技巧

话题深度与广度控制

  • 深度:控制话题层次结构的层数
  • 广度:控制每个话题的分支数量
  • 示例depth: 3degree: 3会产生27个独特话题路径

样本生成策略

  • num_samples: "auto":为每个独特话题生成一个样本
  • num_samples: "50%":为50%的独特话题生成样本
  • num_samples: "200%":生成两倍于独特话题数量的样本

系统提示区分

  • generation.system_prompt:指导LLM生成示例的指令
  • output.system_prompt:包含在训练数据中的系统消息

常见问题解答

Q: DeepFabric支持哪些LLM提供商?

A: 支持OpenAI、Anthropic、Google Gemini、Ollama和OpenRouter。

Q: 需要多少API调用?

A: 取决于话题数量和样本数量。一个深度为3、广度为3的话题树需要27个API调用来生成话题,然后根据样本数量进行额外调用。

Q: 可以自定义工具吗?

A: 是的!DeepFabric支持通过Spin框架添加自定义工具,支持Python、JavaScript、Go和Rust等多种语言。

Q: 数据集格式是什么?

A: DeepFabric生成标准的JSONL格式,兼容Hugging Face数据集和主流训练框架。

开始你的AI训练之旅

DeepFabric为AI开发者提供了一个强大而灵活的工具链,从数据生成到模型评估的完整流程。无论你是构建聊天机器人、代码助手还是复杂的AI智能体,DeepFabric都能帮助你生成高质量的训练数据。

下一步行动

  1. 安装DeepFabric并设置API密钥
  2. 生成你的第一个数据集
  3. 尝试智能体模式进行工具调用训练
  4. 将生成的数据集用于模型训练

记住,高质量的训练数据是AI成功的基石。使用DeepFabric,你可以确保你的模型获得最相关、最多样化的训练数据,从而在实际应用中表现更出色!✨

DeepFabric项目标志 DeepFabric:专注于更基础和高效的模型训练

【免费下载链接】deepfabric Generate High-Quality Synthetics, Train, Measure, and Evaluate in a Single Pipeline 【免费下载链接】deepfabric 项目地址: https://gitcode.com/gh_mirrors/pr/deepfabric

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐