Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
7 changes: 5 additions & 2 deletions src/everyai/data_loader/everyai_dataset.py
Original file line number Diff line number Diff line change
Expand Up @@ -111,7 +111,10 @@ def load(self, path_or_database: str | Path = None, formatter: str = "csv"):
path_or_database = Path(path_or_database)
if not isinstance(path_or_database, Path):
logging.error("Invalid file name: %s", path_or_database)
if path_or_database is not None and path_or_database.suffix != f".{formatter}":
if (
path_or_database is not None
and path_or_database.suffix != f".{formatter}"
):
logging.warning("Change file format to %s", formatter)
path_or_database = path_or_database.with_suffix(f".{formatter}")
else:
Expand Down Expand Up @@ -163,7 +166,7 @@ def save(self, path_or_database: str | Path = None, formatter: str = "csv"):
logging.error("Invalid format: %s", formatter)

@staticmethod
def _initialize_mongo_connection():# -> Database:
def _initialize_mongo_connection(): # -> Database:
mongodb_config = get_config(MONGO_CONFIG_PATH)
result = get_mongo_connection(**mongodb_config)
logging.info("Use default mongodb: %s", result)
Expand Down
8 changes: 2 additions & 6 deletions src/everyai/generator/generate.py
Original file line number Diff line number Diff line change
Expand Up @@ -31,9 +31,7 @@ def _openai_generate(
) -> str:
client = OpenAI(api_key=api_key, base_url=base_url)
messages = [{"role": "user", "content": user_input}]
result = client.chat.completions.create(
messages=messages, model=model_name
)
result = client.chat.completions.create(messages=messages, model=model_name)
return result.choices[0].message.content

def _huggingface_generate(
Expand All @@ -48,9 +46,7 @@ def _huggingface_generate(
logging.info("Using glm-4-9b-chat model")
logging.info("load model from %s", model_path_or_name)
if self.tokenizer is None:
self.tokenizer = AutoTokenizer.from_pretrained(
model_path_or_name
)
self.tokenizer = AutoTokenizer.from_pretrained(model_path_or_name)
else:
self.tokenizer = self.tokenizer
logging.info("Use existing tokenizer")
Expand Down
16 changes: 4 additions & 12 deletions src/everyai/main.py
Original file line number Diff line number Diff line change
Expand Up @@ -39,16 +39,12 @@ def generate():
file_path=data_config["file_path"],
data_type=data_config["data_type"],
)
qa_datas = data_loader.load_data2list(
max_count=data_config["max_count"]
)
qa_datas = data_loader.load_data2list(max_count=data_config["max_count"])
everyai_dataset = EveryaiDataset(
dataname=data_config["data_name"],
ai_list=[generate_config["model_name"]],
)
for data in tqdm(
qa_datas, desc="Generating data", total=len(qa_datas)
):
for data in tqdm(qa_datas, desc="Generating data", total=len(qa_datas)):
ai_response: str = generator.generate(data["question"])
everyai_dataset.insert_ai_response(
question=data["question"],
Expand Down Expand Up @@ -106,9 +102,7 @@ def classfiy():
)
everyai_dataset.load(formatter="mongodb")
logging.info("Loaded data: %s", everyai_dataset.data_name)
texts, labels = everyai_dataset.get_records_with_1ai(
["THUDM/glm-4-9b-chat-hf"]
)
texts, labels = everyai_dataset.get_records_with_1ai(["THUDM/glm-4-9b-chat-hf"])
for classfiy_config in get_config(file_path=CLASSFIY_CONFIG_PATH)[
"classfier_list"
]:
Expand All @@ -119,9 +113,7 @@ def classfiy():
)
case _:
raise ValueError("Classfier type not supported")
text_classfier.load_data(
texts, labels, data_name=everyai_dataset.data_name
)
text_classfier.load_data(texts, labels, data_name=everyai_dataset.data_name)
text_classfier.train()
text_classfier.test()
text_classfier.save_model()
Expand Down