dify/api/schedule/clean_unused_datasets_task.py

import datetime
import time

import click
from sqlalchemy import func, select
from werkzeug.exceptions import NotFound

import app
from configs import dify_config
from core.rag.index_processor.index_processor_factory import IndexProcessorFactory
from extensions.ext_database import db
from extensions.ext_redis import redis_client
from models.dataset import Dataset, DatasetAutoDisableLog, DatasetQuery, Document
from services.feature_service import FeatureService


@app.celery.task(queue="dataset")
def clean_unused_datasets_task():
    click.echo(click.style("Start clean unused datasets indexes.", fg="green"))
    plan_sandbox_clean_day_setting = dify_config.PLAN_SANDBOX_CLEAN_DAY_SETTING
    plan_pro_clean_day_setting = dify_config.PLAN_PRO_CLEAN_DAY_SETTING
    start_at = time.perf_counter()
    plan_sandbox_clean_day = datetime.datetime.now() - datetime.timedelta(days=plan_sandbox_clean_day_setting)
    plan_pro_clean_day = datetime.datetime.now() - datetime.timedelta(days=plan_pro_clean_day_setting)
    while True:
        try:
            # Subquery for counting new documents
            document_subquery_new = (
                db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))
                .filter(
                    Document.indexing_status == "completed",
                    Document.enabled == True,
                    Document.archived == False,
                    Document.updated_at > plan_sandbox_clean_day,
                )
                .group_by(Document.dataset_id)
                .subquery()
            )

            # Subquery for counting old documents
            document_subquery_old = (
                db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))
                .filter(
                    Document.indexing_status == "completed",
                    Document.enabled == True,
                    Document.archived == False,
                    Document.updated_at < plan_sandbox_clean_day,
                )
                .group_by(Document.dataset_id)
                .subquery()
            )

            # Main query with join and filter
            stmt = (
                select(Dataset)
                .outerjoin(document_subquery_new, Dataset.id == document_subquery_new.c.dataset_id)
                .outerjoin(document_subquery_old, Dataset.id == document_subquery_old.c.dataset_id)
                .filter(
                    Dataset.created_at < plan_sandbox_clean_day,
                    func.coalesce(document_subquery_new.c.document_count, 0) == 0,
                    func.coalesce(document_subquery_old.c.document_count, 0) > 0,
                )
                .order_by(Dataset.created_at.desc())
            )

            datasets = db.paginate(stmt, page=1, per_page=50)

        except NotFound:
            break
        if datasets.items is None or len(datasets.items) == 0:
            break
        for dataset in datasets:
            dataset_query = (
                db.session.query(DatasetQuery)
                .filter(DatasetQuery.created_at > plan_sandbox_clean_day, DatasetQuery.dataset_id == dataset.id)
                .all()
            )
            if not dataset_query or len(dataset_query) == 0:
                try:
                    # add auto disable log
                    documents = (
                        db.session.query(Document)
                        .filter(
                            Document.dataset_id == dataset.id,
                            Document.enabled == True,
                            Document.archived == False,
                        )
                        .all()
                    )
                    for document in documents:
                        dataset_auto_disable_log = DatasetAutoDisableLog(
                            tenant_id=dataset.tenant_id,
                            dataset_id=dataset.id,
                            document_id=document.id,
                        )
                        db.session.add(dataset_auto_disable_log)
                    # remove index
                    index_processor = IndexProcessorFactory(dataset.doc_form).init_index_processor()
                    index_processor.clean(dataset, None)

                    # update document
                    update_params = {Document.enabled: False}

                    db.session.query(Document).filter_by(dataset_id=dataset.id).update(update_params)
                    db.session.commit()
                    click.echo(click.style("Cleaned unused dataset {} from db success!".format(dataset.id), fg="green"))
                except Exception as e:
                    click.echo(
                        click.style("clean dataset index error: {} {}".format(e.__class__.__name__, str(e)), fg="red")
                    )
    while True:
        try:
            # Subquery for counting new documents
            document_subquery_new = (
                db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))
                .filter(
                    Document.indexing_status == "completed",
                    Document.enabled == True,
                    Document.archived == False,
                    Document.updated_at > plan_pro_clean_day,
                )
                .group_by(Document.dataset_id)
                .subquery()
            )

            # Subquery for counting old documents
            document_subquery_old = (
                db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))
                .filter(
                    Document.indexing_status == "completed",
                    Document.enabled == True,
                    Document.archived == False,
                    Document.updated_at < plan_pro_clean_day,
                )
                .group_by(Document.dataset_id)
                .subquery()
            )

            # Main query with join and filter
            stmt = (
                select(Dataset)
                .outerjoin(document_subquery_new, Dataset.id == document_subquery_new.c.dataset_id)
                .outerjoin(document_subquery_old, Dataset.id == document_subquery_old.c.dataset_id)
                .filter(
                    Dataset.created_at < plan_pro_clean_day,
                    func.coalesce(document_subquery_new.c.document_count, 0) == 0,
                    func.coalesce(document_subquery_old.c.document_count, 0) > 0,
                )
                .order_by(Dataset.created_at.desc())
            )
            datasets = db.paginate(stmt, page=1, per_page=50)

        except NotFound:
            break
        if datasets.items is None or len(datasets.items) == 0:
            break
        for dataset in datasets:
            dataset_query = (
                db.session.query(DatasetQuery)
                .filter(DatasetQuery.created_at > plan_pro_clean_day, DatasetQuery.dataset_id == dataset.id)
                .all()
            )
            if not dataset_query or len(dataset_query) == 0:
                try:
                    features_cache_key = f"features:{dataset.tenant_id}"
                    plan_cache = redis_client.get(features_cache_key)
                    if plan_cache is None:
                        features = FeatureService.get_features(dataset.tenant_id)
                        redis_client.setex(features_cache_key, 600, features.billing.subscription.plan)
                        plan = features.billing.subscription.plan
                    else:
                        plan = plan_cache.decode()
                    if plan == "sandbox":
                        # remove index
                        index_processor = IndexProcessorFactory(dataset.doc_form).init_index_processor()
                        index_processor.clean(dataset, None)

                        # update document
                        update_params = {Document.enabled: False}

                        db.session.query(Document).filter_by(dataset_id=dataset.id).update(update_params)
                        db.session.commit()
                        click.echo(
                            click.style("Cleaned unused dataset {} from db success!".format(dataset.id), fg="green")
                        )
                except Exception as e:
                    click.echo(
                        click.style("clean dataset index error: {} {}".format(e.__class__.__name__, str(e)), fg="red")
                    )
    end_at = time.perf_counter()
    click.echo(click.style("Cleaned unused dataset from db success latency: {}".format(end_at - start_at), fg="green"))
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`import datetime`
			`import time`
improve: introduce isort for linting Python imports (#1983) 2024-01-12 12:34:01 +08:00
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`import click`
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`from sqlalchemy import func, select`
improve: introduce isort for linting Python imports (#1983) 2024-01-12 12:34:01 +08:00			`from werkzeug.exceptions import NotFound`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00
enhancement: introduce Ruff for Python linter for reordering and removing unused imports with automated pre-commit and sytle check (#2366) 2024-02-06 13:21:13 +08:00			`import app`
refactor(api): switch to dify_config with Pydantic in controllers and schedule (#6237) 2024-07-12 16:51:43 +08:00			`from configs import dify_config`
Feat/dify rag (#2528) Co-authored-by: jyong <jyong@dify.ai> 2024-02-22 23:31:57 +08:00			`from core.rag.index_processor.index_processor_factory import IndexProcessorFactory`
enhancement: introduce Ruff for Python linter for reordering and removing unused imports with automated pre-commit and sytle check (#2366) 2024-02-06 13:21:13 +08:00			`from extensions.ext_database import db`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`from extensions.ext_redis import redis_client`
Feat/support parent child chunk (#12092) 2024-12-25 19:49:07 +08:00			`from models.dataset import Dataset, DatasetAutoDisableLog, DatasetQuery, Document`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`from services.feature_service import FeatureService`
enhancement: introduce Ruff for Python linter for reordering and removing unused imports with automated pre-commit and sytle check (#2366) 2024-02-06 13:21:13 +08:00
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`@app.celery.task(queue="dataset")`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`def clean_unused_datasets_task():`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`click.echo(click.style("Start clean unused datasets indexes.", fg="green"))`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`plan_sandbox_clean_day_setting = dify_config.PLAN_SANDBOX_CLEAN_DAY_SETTING`
			`plan_pro_clean_day_setting = dify_config.PLAN_PRO_CLEAN_DAY_SETTING`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`start_at = time.perf_counter()`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`plan_sandbox_clean_day = datetime.datetime.now() - datetime.timedelta(days=plan_sandbox_clean_day_setting)`
			`plan_pro_clean_day = datetime.datetime.now() - datetime.timedelta(days=plan_pro_clean_day_setting)`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`while True:`
			`try:`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`# Subquery for counting new documents`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`document_subquery_new = (`
			`db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))`
			`.filter(`
			`Document.indexing_status == "completed",`
			`Document.enabled == True,`
			`Document.archived == False,`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Document.updated_at > plan_sandbox_clean_day,`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`)`
			`.group_by(Document.dataset_id)`
			`.subquery()`
			`)`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00
			`# Subquery for counting old documents`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`document_subquery_old = (`
			`db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))`
			`.filter(`
			`Document.indexing_status == "completed",`
			`Document.enabled == True,`
			`Document.archived == False,`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Document.updated_at < plan_sandbox_clean_day,`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`)`
			`.group_by(Document.dataset_id)`
			`.subquery()`
			`)`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00
			`# Main query with join and filter`
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`stmt = (`
			`select(Dataset)`
			`.outerjoin(document_subquery_new, Dataset.id == document_subquery_new.c.dataset_id)`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`.outerjoin(document_subquery_old, Dataset.id == document_subquery_old.c.dataset_id)`
			`.filter(`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Dataset.created_at < plan_sandbox_clean_day,`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`func.coalesce(document_subquery_new.c.document_count, 0) == 0,`
			`func.coalesce(document_subquery_old.c.document_count, 0) > 0,`
			`)`
			`.order_by(Dataset.created_at.desc())`
			`)`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`datasets = db.paginate(stmt, page=1, per_page=50)`

Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`except NotFound:`
			`break`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`if datasets.items is None or len(datasets.items) == 0:`
			`break`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`for dataset in datasets:`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`dataset_query = (`
			`db.session.query(DatasetQuery)`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`.filter(DatasetQuery.created_at > plan_sandbox_clean_day, DatasetQuery.dataset_id == dataset.id)`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`.all()`
			`)`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`if not dataset_query or len(dataset_query) == 0:`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`try:`
Feat/support parent child chunk (#12092) 2024-12-25 19:49:07 +08:00			`# add auto disable log`
			`documents = (`
			`db.session.query(Document)`
			`.filter(`
			`Document.dataset_id == dataset.id,`
			`Document.enabled == True,`
			`Document.archived == False,`
			`)`
			`.all()`
			`)`
			`for document in documents:`
			`dataset_auto_disable_log = DatasetAutoDisableLog(`
			`tenant_id=dataset.tenant_id,`
			`dataset_id=dataset.id,`
			`document_id=document.id,`
			`)`
			`db.session.add(dataset_auto_disable_log)`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`# remove index`
			`index_processor = IndexProcessorFactory(dataset.doc_form).init_index_processor()`
			`index_processor.clean(dataset, None)`

			`# update document`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`update_params = {Document.enabled: False}`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`db.session.query(Document).filter_by(dataset_id=dataset.id).update(update_params)`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`db.session.commit()`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`click.echo(click.style("Cleaned unused dataset {} from db success!".format(dataset.id), fg="green"))`
Feat/optimize clean dataset logic (#6384) 2024-07-17 17:36:11 +08:00			`except Exception as e:`
			`click.echo(`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`click.style("clean dataset index error: {} {}".format(e.__class__.__name__, str(e)), fg="red")`
			`)`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`while True:`
			`try:`
			`# Subquery for counting new documents`
			`document_subquery_new = (`
			`db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))`
			`.filter(`
			`Document.indexing_status == "completed",`
			`Document.enabled == True,`
			`Document.archived == False,`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Document.updated_at > plan_pro_clean_day,`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`)`
			`.group_by(Document.dataset_id)`
			`.subquery()`
			`)`

			`# Subquery for counting old documents`
			`document_subquery_old = (`
			`db.session.query(Document.dataset_id, func.count(Document.id).label("document_count"))`
			`.filter(`
			`Document.indexing_status == "completed",`
			`Document.enabled == True,`
			`Document.archived == False,`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Document.updated_at < plan_pro_clean_day,`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`)`
			`.group_by(Document.dataset_id)`
			`.subquery()`
			`)`

			`# Main query with join and filter`
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`stmt = (`
			`select(Dataset)`
			`.outerjoin(document_subquery_new, Dataset.id == document_subquery_new.c.dataset_id)`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`.outerjoin(document_subquery_old, Dataset.id == document_subquery_old.c.dataset_id)`
			`.filter(`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`Dataset.created_at < plan_pro_clean_day,`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`func.coalesce(document_subquery_new.c.document_count, 0) == 0,`
			`func.coalesce(document_subquery_old.c.document_count, 0) > 0,`
			`)`
			`.order_by(Dataset.created_at.desc())`
			`)`
fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`datasets = db.paginate(stmt, page=1, per_page=50)`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00
			`except NotFound:`
			`break`
			`if datasets.items is None or len(datasets.items) == 0:`
			`break`
			`for dataset in datasets:`
			`dataset_query = (`
			`db.session.query(DatasetQuery)`
update dataset clean rule (#9426) 2024-10-17 10:40:22 +08:00			`.filter(DatasetQuery.created_at > plan_pro_clean_day, DatasetQuery.dataset_id == dataset.id)`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`.all()`
			`)`
			`if not dataset_query or len(dataset_query) == 0:`
			`try:`
			`features_cache_key = f"features:{dataset.tenant_id}"`
Feat/clean message records (#10588) 2024-11-18 16:57:39 +08:00			`plan_cache = redis_client.get(features_cache_key)`
			`if plan_cache is None:`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`features = FeatureService.get_features(dataset.tenant_id)`
			`redis_client.setex(features_cache_key, 600, features.billing.subscription.plan)`
			`plan = features.billing.subscription.plan`
Feat/clean message records (#10588) 2024-11-18 16:57:39 +08:00			`else:`
			`plan = plan_cache.decode()`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`if plan == "sandbox":`
			`# remove index`
			`index_processor = IndexProcessorFactory(dataset.doc_form).init_index_processor()`
			`index_processor.clean(dataset, None)`

			`# update document`
			`update_params = {Document.enabled: False}`

fix: replace all dataset.Model.query to db.session.query(Model) (#19509) 2025-05-12 13:52:33 +08:00			`db.session.query(Document).filter_by(dataset_id=dataset.id).update(update_params)`
add clean 7 days datasets (#9424) 2024-10-16 22:24:50 +08:00			`db.session.commit()`
			`click.echo(`
			`click.style("Cleaned unused dataset {} from db success!".format(dataset.id), fg="green")`
			`)`
			`except Exception as e:`
			`click.echo(`
			`click.style("clean dataset index error: {} {}".format(e.__class__.__name__, str(e)), fg="red")`
			`)`
Add data clean schedule (#1859) Co-authored-by: jyong <jyong@dify.ai> 2024-01-02 15:29:18 +08:00			`end_at = time.perf_counter()`
chore(api): Introduce Ruff Formatter. (#7291) 2024-08-15 12:54:05 +08:00			`click.echo(click.style("Cleaned unused dataset from db success latency: {}".format(end_at - start_at), fg="green"))`